Depthwise convolution
Чтобы понять идею, представьте цветное фото: три канала — красный, зелёный, синий. Обычная свёртка берёт кусочек изображения и сразу складывает значения по всем трём цветам, выдавая один итог. Глубинная же прогоняет фильтр 3x3 поочерёдно по каждому каналу, создавая три новых канала. На следующем этапе — точечной свёртке 1x1 — они смешиваются. Двухшаговый процесс даёт гибкость: сеть изучает пространственные узоры внутри каналов, не расплачиваясь огромным набором весов, как в полной свёртке. Это похоже на врача, который сначала осматривает кожу, кости и мышцы отдельно, а потом собирает целостную картину травмы.
Пример: приложение распознавания растений на телефоне использует MobileNet. Фото цветка сжимается до ста каналов, каждый обрабатывается своим небольшим фильтром, после чего несколько точечных свёрток объединяют особенности в «портрет» объекта. Результат — мгновенный ответ без перегрева устройства и расхода батареи. В итоге глубинная свёртка — это элегантный способ заставить обычную свёртку работать экономнее: она разделяет анализ по каналам и смешивание, снижая нагрузку в разы, что делает современный ИИ на устройствах возможным.
Поделиться