Faster R-CNN
До неё обнаружение шло медленно: сначала предлагалось много случайных фрагментов, затем каждый обрабатывался тяжёлой сетью отдельно. Faster R-CNN в 2015 году радикально ускорила процесс, приблизив его к реальному времени, и показала рекордную точность. Практически все современные системы распознавания — от беспилотников до контроля качества на заводах — используют идеи этой работы.
Как это работает: нейросеть сначала смотрит на всё изображение целиком и извлекает общие признаки (границы, текстуры, силуэты). Затем модуль Region Proposal Network пробегает по карте признаков и предлагает области, где вероятны объекты. Главная хитрость в том, что признаки вычисляются один раз для всей картинки и переиспользуются для всех кандидатов. Далее классификатор определяет, что находится в каждой области, и уточняет границы рамки.
Пример: в автопилоте Faster R-CNN непрерывно анализирует видеопоток, находит пешеходов, автомобили и знаки. На специализированном чипе она обрабатывает десятки кадров в секунду, давая время на реакцию.
Вывод: Faster R-CNN объединила выдвижение гипотез и классификацию в одну обучаемую сеть, показав, как совместить скорость и точность. Она остаётся надёжной рабочей лошадкой в промышленных решениях.
Поделиться