глоссарий

Bounding box

Bounding box

Bounding box — это минимальный прямоугольник, выровненный по осям координат, который плотно обхватывает объект на изображении или в 3D-сцене. Проще говоря, рамка вокруг кота, машины или лица, указывающая алгоритму: «объект здесь».

Он важен, потому что компьютерное зрение начинается с вопроса «где?». Прежде чем распознать объект, его нужно локализовать. Bounding box — стандартный способ локализации: вместо сложного контура достаточно грубых границ. Это упрощает обучение нейросетей: разметка занимает секунды, а модель предсказывает всего четыре числа — координаты центра, ширину и высоту.

Как это работает? Представьте видоискатель фотоаппарата: наводя резкость на пешехода, вы мысленно заключаете его в рамку. Так же действует свёрточная нейросеть: сканирует изображение фрагментами, находит характерные черты и «укутывает» зону рамкой. Чем увереннее сеть, тем плотнее рамка. Если объектов несколько, каждая рамка — отдельный кандидат.

Пример — автопилот. Камера в автомобиле подаёт кадры нейросети, которая в реальном времени рисует bounding box вокруг людей, велосипедистов и машин. По координатам рамки автопилот вычисляет расстояние и решает, тормозить или объезжать. Миллисекунды на расчёт прямоугольника спасают жизни.

Итак, bounding box — элементарный, но мощный кирпичик компьютерного зрения. Он превращает бесконечное пространство пикселей в набор координат, с которым работают другие алгоритмы — от распознавания лиц до контроля качества. С маленького прямоугольника начинается искусственное зрение.