Згорткові нейронні мережі (CNN) для комп'ютерного зору
3 вересня 2026 р.

Коли йдеться про роботу із зображеннями, звичайна повнозвʼязна нейронна мережа працює погано. Згорткові нейронні мережі (Convolutional Neural Networks, CNN) розробили саме для цього — і вони на роки стали стандартом у компʼютерному зорі.
Проблема зі звичайними мережами
Зображення — це багато чисел. Навіть невелика картинка 200×200 пікселів у кольорі містить 120 тисяч значень. Якби кожен піксель зʼєднати з кожним нейроном першого шару, кількість параметрів стала б астрономічною, а мережа миттєво перенавчалася б.
Крім того, звичайна мережа не розуміє просторової структури. Для неї піксель у кутку й піксель у центрі — просто окремі числа, хоча в зображенні важливо, що поруч із чим розташоване.
Ідея згортки
CNN розвʼязує обидві проблеми за допомогою згортки (convolution). Замість того щоб дивитися на все зображення одразу, невеликий фільтр (наприклад, 3×3 пікселі) ковзає по картинці й у кожному місці шукає певний патерн — край, кут, пляму кольору.
Ключових переваг дві. По-перше, той самий фільтр застосовується по всьому зображенню, тож параметрів набагато менше. По-друге, якщо фільтр навчився знаходити, скажімо, вертикальний край, він знаходитиме його будь-де на картинці. Цю властивість називають інваріантністю до зсуву.
Ієрархія ознак
CNN складається з багатьох згорткових шарів, і кожен працює на своєму рівні абстракції:
- перші шари вловлюють прості ознаки — краї, лінії, переходи кольору;
- середні комбінують їх у текстури та форми;
- глибші розпізнають частини обʼєктів — око, колесо, літеру;
- останні збирають усе в цілі обʼєкти.
Ця ієрархія формується автоматично під час навчання — інженеру не потрібно описувати ознаки вручну.
Пулінг
Між згортковими шарами часто ставлять шар пулінгу (pooling). Його завдання — зменшити розмір даних, залишивши найважливіше. Найпоширеніший варіант, max pooling, з кожної невеликої ділянки бере максимальне значення.
Пулінг робить мережу компактнішою, швидшою й стійкішою до незначних зсувів обʼєкта на зображенні.
Типова архітектура
Класична CNN виглядає як чергування згорткових шарів і пулінгу, після яких дані «розгортаються» у вектор і подаються на кілька повнозвʼязних шарів, що видають фінальний прогноз. Відомі архітектури — LeNet, AlexNet, VGG, ResNet — розвивали цю ідею, роблячи мережі глибшими й точнішими.
Де застосовують CNN
Сфера застосування широка: класифікація зображень, виявлення обʼєктів на фото й відео, розпізнавання облич, аналіз медичних знімків, безпілотні автомобілі. CNN також використовують для аналізу звуку (через спектрограми) і навіть для деяких задач з текстом.
Що прийшло на зміну
Останніми роками архітектури-трансформери (Vision Transformers) почали конкурувати з CNN і подекуди їх перевершувати, особливо на дуже великих наборах даних. Проте CNN залишаються надзвичайно ефективними, зрозумілими й досі широко застосовуються, особливо коли даних не так багато.
Підсумок
Згорткові нейронні мережі створені для зображень: замість зʼєднання всіх пікселів з усіма нейронами вони використовують невеликі фільтри, що ковзають по картинці й шукають патерни. Через багато шарів CNN будує ієрархію ознак — від простих країв до цілих обʼєктів, — а пулінг робить її компактнішою й стійкішою. Саме ця конструкція зробила прорив у компʼютерному зорі можливим.