глоссарий

Depthwise convolution

Depthwise convolution

Глубинная свёртка — это разновидность свёртки в нейросетях, при которой фильтр обрабатывает каждый канал изображения или другого многоканального сигнала отдельно, а не смешивает их вместе. В отличие от обычной свёртки, где каждый выходной пиксель суммирует информацию сразу со всех каналов, глубинная свёртка работает с ними как с независимыми слоями. Термин важен, поскольку лежит в основе архитектуры MobileNet и других эффективных моделей, позволяя достигать высокой точности при резком сокращении числа параметров и вычислительных операций. Такие сети подходят для смартфонов, дронов и устройств с ограниченными ресурсами.

Чтобы понять идею, представьте цветное фото: три канала — красный, зелёный, синий. Обычная свёртка берёт кусочек изображения и сразу складывает значения по всем трём цветам, выдавая один итог. Глубинная же прогоняет фильтр 3x3 поочерёдно по каждому каналу, создавая три новых канала. На следующем этапе — точечной свёртке 1x1 — они смешиваются. Двухшаговый процесс даёт гибкость: сеть изучает пространственные узоры внутри каналов, не расплачиваясь огромным набором весов, как в полной свёртке. Это похоже на врача, который сначала осматривает кожу, кости и мышцы отдельно, а потом собирает целостную картину травмы.

Пример: приложение распознавания растений на телефоне использует MobileNet. Фото цветка сжимается до ста каналов, каждый обрабатывается своим небольшим фильтром, после чего несколько точечных свёрток объединяют особенности в «портрет» объекта. Результат — мгновенный ответ без перегрева устройства и расхода батареи. В итоге глубинная свёртка — это элегантный способ заставить обычную свёртку работать экономнее: она разделяет анализ по каналам и смешивание, снижая нагрузку в разы, что делает современный ИИ на устройствах возможным.