YOLO
Именно YOLO сделал возможной массовую детекцию объектов в реальном времени. До его появления в 2016 году алгоритмы были либо точными, но медленными, либо быстрыми, но неточными. YOLO нашёл золотую середину, поэтому сегодня на нём работают беспилотные автомобили, видеонаблюдение, умные камеры на складах и приложения для подсчёта людей.
Как это работает? Кадр делится на сетку, например 13×13. Каждая клетка отвечает за объекты, чей центр попал в неё. Нейросеть один раз смотрит на изображение и для каждой клетки предсказывает, какие объекты находятся и какие рамки их ограничивают. Если несколько соседних клеток обнаружили один и тот же объект, алгоритм оставляет самую достоверную рамку и убирает дубли.
Классический пример — видеопоток с камеры беспилотного автомобиля. На каждом кадре алгоритм за десятки миллисекунд выделяет машины, грузовики, велосипедистов, пешеходов и знаки. Информация мгновенно передаётся системе управления, которая может затормозить или перестроиться, не дожидаясь полного анализа кадра.
Итог: YOLO показал, что для качественного понимания изображения не нужно рассматривать каждый пиксель. Один целостный взгляд — и машина видит мир в реальном времени.
Поделиться