Bounding box
Он важен, потому что компьютерное зрение начинается с вопроса «где?». Прежде чем распознать объект, его нужно локализовать. Bounding box — стандартный способ локализации: вместо сложного контура достаточно грубых границ. Это упрощает обучение нейросетей: разметка занимает секунды, а модель предсказывает всего четыре числа — координаты центра, ширину и высоту.
Как это работает? Представьте видоискатель фотоаппарата: наводя резкость на пешехода, вы мысленно заключаете его в рамку. Так же действует свёрточная нейросеть: сканирует изображение фрагментами, находит характерные черты и «укутывает» зону рамкой. Чем увереннее сеть, тем плотнее рамка. Если объектов несколько, каждая рамка — отдельный кандидат.
Пример — автопилот. Камера в автомобиле подаёт кадры нейросети, которая в реальном времени рисует bounding box вокруг людей, велосипедистов и машин. По координатам рамки автопилот вычисляет расстояние и решает, тормозить или объезжать. Миллисекунды на расчёт прямоугольника спасают жизни.
Итак, bounding box — элементарный, но мощный кирпичик компьютерного зрения. Он превращает бесконечное пространство пикселей в набор координат, с которым работают другие алгоритмы — от распознавания лиц до контроля качества. С маленького прямоугольника начинается искусственное зрение.
Поделиться