глоссарий

YOLO

YOLO

YOLO — алгоритм компьютерного зрения, который находит и распознаёт объекты на фото или видео за один проход модели. Название расшифровывается как You Only Look Once («ты смотришь лишь один раз»). В отличие от старых методов, сканировавших изображение по фрагментам, YOLO обрабатывает кадр целиком и сразу выдаёт рамки с подписями: человек, велосипед, светофор.

Именно YOLO сделал возможной массовую детекцию объектов в реальном времени. До его появления в 2016 году алгоритмы были либо точными, но медленными, либо быстрыми, но неточными. YOLO нашёл золотую середину, поэтому сегодня на нём работают беспилотные автомобили, видеонаблюдение, умные камеры на складах и приложения для подсчёта людей.

Как это работает? Кадр делится на сетку, например 13×13. Каждая клетка отвечает за объекты, чей центр попал в неё. Нейросеть один раз смотрит на изображение и для каждой клетки предсказывает, какие объекты находятся и какие рамки их ограничивают. Если несколько соседних клеток обнаружили один и тот же объект, алгоритм оставляет самую достоверную рамку и убирает дубли.

Классический пример — видеопоток с камеры беспилотного автомобиля. На каждом кадре алгоритм за десятки миллисекунд выделяет машины, грузовики, велосипедистов, пешеходов и знаки. Информация мгновенно передаётся системе управления, которая может затормозить или перестроиться, не дожидаясь полного анализа кадра.

Итог: YOLO показал, что для качественного понимания изображения не нужно рассматривать каждый пиксель. Один целостный взгляд — и машина видит мир в реальном времени.