глоссарий

Anchor box

Anchor box

Anchor box — это заранее заданный прямоугольник-шаблон для обнаружения объектов на изображении. Проще говоря, набор «заготовок» разной формы и размера, которые алгоритм прикладывает к картинке, чтобы понять, что где находится. Без них нейросеть перебирала бы миллионы положений и размеров — это медленно. Якорные боксы сводят задачу к сравнению с ограниченным числом вариантов, делая детекцию быстрой и пригодной для реальных систем — от автопилота до распознавания лиц.

Как это работает? Представьте поиск знакомого в толпе: вы сканируете фото окнами разного размера — маленькими для лиц вблизи, большими для фигур издалека. Так и якорные боксы: на картинку накладывается сетка, и в каждой ячейке алгоритм проверяет, похож ли объект на один из шаблонов. Если бокс совпал по пропорциям с автомобилем, сеть «поправляет» его границы и сообщает класс. Чем больше разнообразных шаблонов, тем точнее поиск, но и тем больше вычислений, поэтому количество и форму боксов подбирают под задачу.

Пример: система видеонаблюдения на парковке. Нейросеть использует вытянутые боксы для мотоциклов, квадратные для легковых машин, широкие для грузовиков. Когда камера видит въезжающий транспорт, алгоритм сопоставляет его с шаблонами и выделяет контур, даже если машина частично перекрыта. Итог: anchor box — это компромисс между точностью и скоростью, лежащий в основе современных детекторов, таких как YOLO и Faster R-CNN. Понимание этой концепции объясняет, почему ИИ видит мир не как человек, а как набор объектов, вписанных в заранее известные рамки.