Feature pyramid
Зачем она нужна? Нейросеть понимает изображение через слои: ранние слои ловят мелкие детали — края, углы, текстуры, а глубокие — смысл, например, «это кошка» или «это дорога». Но есть проблема: когда сеть проходит всё глубже, мелкие объекты исчезают, их детали размываются. Если брать только последний слой, мы увидим крупные вещи, но потеряем мелочь. Если только ранний — запутаемся в деталях и не поймём общую картину. Пирамида признаков соединяет оба подхода.
Как это работает интуитивно? Сеть строит несколько копий карты признаков с разным разрешением. Глубокие слои уменьшают картинку, но дают смысл; ранние сохраняют чёткость, но без контекста. Пирамида связывает их перекрёстными связями: идёт сверху вниз, добавляя мелкие детали к абстрактным признакам. Получается многоуровневое описание, где каждый масштаб «виден» и крупно, и мелко.
Вот прикладной пример: автопилот автомобиля должен одновременно заметить пешехода вдалеке (маленький объект) и дорожный знак прямо перед собой (крупный). Без пирамиды сеть скорее всего пропустила бы пешехода на дальнем плане. С пирамидой она выделяет признаки на разных масштабах и находит и далёкую фигурку, и близкий знак. Тот же приём используют в медицинской диагностике, когда нужно найти маленькую опухоль на снимке, и в роботах, сортирующих детали.
Итог прост: пирамида признаков — это способ сказать нейросети «не пропускай ни крупное, ни мелкое». Она стала стандартом для задач, где важны все детали — от поиска объектов до сегментации изображений. Благодаря ей модели стали заметно точнее, а мы — ближе к тому, чтобы машины действительно понимали, что видят.
Поделиться