глоссарий

Pointwise convolution

Pointwise convolution

Pointwise convolution — это операция свёртки, в которой ядро фильтра имеет размер 1×1. В отличие от классической свёртки, которая захватывает пространственные закономерности изображения, точечная свёртка работает лишь с одним пикселем, зато сразу по всем его цветовым каналам. По сути, это способ комбинировать информацию от разных каналов, не смешивая соседние пиксели. Термин стал ключевым в архитектурах нейросетей вроде MobileNet, ведь именно он позволяет резко сократить вычисления при сохранении качества.

Для чего это нужно? Пространственная свёртка с большим ядром, скажем 3×3, требует перемножений сразу по всем каналам — это очень дорого. Идея в том, чтобы разделить операцию на два шага: сначала лёгкая пространственная свёртка по каждому каналу отдельно, а затем точечная свёртка 1×1, которая «смешивает» результаты. Так вы получаете тот же эффект, что и у тяжёлой свёртки, но с куда меньшим числом операций. Интуитивно это напоминает разбор задачи: сначала вы рассматриваете каждый цветовой слой картинки по отдельности, а потом, словно накладывая их друг на друга, решаете, какие сочетания важны для распознавания объекта.

Прикладной пример: на смартфоне работает детектор лиц. Классическая нейросеть с большими ядрами была бы слишком медленной для батареи. Инженеры применяют архитектуру с точечными свёртками: сначала аппаратно быстро выделяются контуры, а затем точечная свёртка 1×1, сопоставляя каналы признаков, определяет, что это именно глаза, а не случайные тени. Итог — распознавание занимает миллисекунды и не греет устройство.

Коротко: pointwise convolution — незаметный герой эффективного ИИ, который делает глубокие модели быстрыми и компактными. Игнорируя соседей и фокусируясь на связях между каналами, он позволяет нейросетям работать даже на слабых устройствах.