Mosaic augmentation
Метод важен тем, что рушит привычные картинки мира. Модель сталкивается с дикими сочетаниями: кошка в офисе, пешеход у грузовика, дерево посреди дороги. Такой винегрет снижает переобучение и учит сеть ловить суть, а не цепляться за случайные детали фона. Особенно полезен приём для детекторов и сегментации.
Как это работает интуитивно? Вы берёте четыре фото, делите каждое пополам и монтируете общий квадрат. Часть объектов обрезана краями ячеек, фон перемешан. Чтобы выдать ответ, модель анализирует целостный кадр и опирается на обрывки знаний. Постепенно она распознаёт предмет даже в неудобной позе, с обрезанным краем или в чужом окружении.
Пример. При обучении детектора для беспилотника на одном мозаичном кадре встречаются пешеход, кусок автобуса, знак и тротуар из разных съёмок. После тысяч таких комбинаций сеть найдёт пешехода даже в малой части кадра или среди веток. В реальности это разница между надёжным торможением и пропущенной угрозой.
Итог. Mosaic augmentation — дешёвый способ сделать модель устойчивее. Четыре картинки вместо одной дают больше, чем кажется: немного «перемешанной» реальности — и сеть заметно крепче в сложных сценах.
Поделиться