Глибоке навчання

Згорткові нейронні мережі (CNN) для комп'ютерного зору

3 вересня 2026 р.

Згорткові нейронні мережі (CNN) для комп'ютерного зору

Коли йдеться про роботу із зображеннями, звичайна повнозвʼязна нейронна мережа працює погано. Згорткові нейронні мережі (Convolutional Neural Networks, CNN) розробили саме для цього — і вони на роки стали стандартом у компʼютерному зорі.

Проблема зі звичайними мережами

Зображення — це багато чисел. Навіть невелика картинка 200×200 пікселів у кольорі містить 120 тисяч значень. Якби кожен піксель зʼєднати з кожним нейроном першого шару, кількість параметрів стала б астрономічною, а мережа миттєво перенавчалася б.

Крім того, звичайна мережа не розуміє просторової структури. Для неї піксель у кутку й піксель у центрі — просто окремі числа, хоча в зображенні важливо, що поруч із чим розташоване.

Ідея згортки

CNN розвʼязує обидві проблеми за допомогою згортки (convolution). Замість того щоб дивитися на все зображення одразу, невеликий фільтр (наприклад, 3×3 пікселі) ковзає по картинці й у кожному місці шукає певний патерн — край, кут, пляму кольору.

Ключових переваг дві. По-перше, той самий фільтр застосовується по всьому зображенню, тож параметрів набагато менше. По-друге, якщо фільтр навчився знаходити, скажімо, вертикальний край, він знаходитиме його будь-де на картинці. Цю властивість називають інваріантністю до зсуву.

Ієрархія ознак

CNN складається з багатьох згорткових шарів, і кожен працює на своєму рівні абстракції:

  • перші шари вловлюють прості ознаки — краї, лінії, переходи кольору;
  • середні комбінують їх у текстури та форми;
  • глибші розпізнають частини обʼєктів — око, колесо, літеру;
  • останні збирають усе в цілі обʼєкти.

Ця ієрархія формується автоматично під час навчання — інженеру не потрібно описувати ознаки вручну.

Пулінг

Між згортковими шарами часто ставлять шар пулінгу (pooling). Його завдання — зменшити розмір даних, залишивши найважливіше. Найпоширеніший варіант, max pooling, з кожної невеликої ділянки бере максимальне значення.

Пулінг робить мережу компактнішою, швидшою й стійкішою до незначних зсувів обʼєкта на зображенні.

Типова архітектура

Класична CNN виглядає як чергування згорткових шарів і пулінгу, після яких дані «розгортаються» у вектор і подаються на кілька повнозвʼязних шарів, що видають фінальний прогноз. Відомі архітектури — LeNet, AlexNet, VGG, ResNet — розвивали цю ідею, роблячи мережі глибшими й точнішими.

Де застосовують CNN

Сфера застосування широка: класифікація зображень, виявлення обʼєктів на фото й відео, розпізнавання облич, аналіз медичних знімків, безпілотні автомобілі. CNN також використовують для аналізу звуку (через спектрограми) і навіть для деяких задач з текстом.

Що прийшло на зміну

Останніми роками архітектури-трансформери (Vision Transformers) почали конкурувати з CNN і подекуди їх перевершувати, особливо на дуже великих наборах даних. Проте CNN залишаються надзвичайно ефективними, зрозумілими й досі широко застосовуються, особливо коли даних не так багато.

Підсумок

Згорткові нейронні мережі створені для зображень: замість зʼєднання всіх пікселів з усіма нейронами вони використовують невеликі фільтри, що ковзають по картинці й шукають патерни. Через багато шарів CNN будує ієрархію ознак — від простих країв до цілих обʼєктів, — а пулінг робить її компактнішою й стійкішою. Саме ця конструкція зробила прорив у компʼютерному зорі можливим.

Шукаєте роботу?

Перегляньте відкриті вакансії у Data Science, ML та аналітиці.

До вакансій