Convolution math
На интуитивном уровне свёртка работает как скользящее окно. Представьте, что вы ведёте пальцем по фотографии, но смотрите не на весь снимок, а лишь на маленький квадратик вокруг пальца. Внутри этого квадратика у вас есть набор весов — матрица, которую называют ядром или фильтром. Вы перемножаете каждый пиксель из текущего участка на соответствующий вес фильтра, складываете все получившиеся числа и записываете результат в центр нового изображения. Затем сдвигаете окно на один шаг и повторяете. Так вы проходите всю картинку, превращая её в карту реакций. Если фильтр подобран так, чтобы реагировать на вертикальные линии, то на выходе будут ярко видны только вертикальные границы, а всё остальное погаснет.
Прикладной пример — распознавание дорожных знаков в автопилоте. Камера делает снимок, нейросеть пропускает его через десятки свёрточных слоёв. Первые слои ловят простые паттерны: края, углы, изгибы. Следующие слои, комбинируя эти паттерны, узнают более сложные формы — буквы, цифры, символы. В итоге свёртка превращает хаос пикселей в понятное «знак „Ограничение 40“». Точно так же она работает в фильтрах Instagram, при улучшении старых фотографий и в шумоподавлении.
Вывод: свёртка — это способ найти закономерности в данных, не рассматривая всё сразу, а изучая локальные кусочки и обобщая их. Именно она даёт машинам острое зрение, позволяя ИИ безопасно вести автомобиль, ставить диагнозы и превращать размытые кадры в чёткие.
Поделиться