глоссарий

Mosaic augmentation

Mosaic augmentation

Mosaic augmentation — это приём расширения данных для компьютерного зрения, при котором четыре случайных изображения склеиваются в одно полотно по схеме два на два. Полученный гибрид сжимается до исходного размера и подаётся нейросети как обычный кадр. Визуально это напоминает мозаику: каждая клетка — отдельное фото, но вместе они образуют новую сцену.

Метод важен тем, что рушит привычные картинки мира. Модель сталкивается с дикими сочетаниями: кошка в офисе, пешеход у грузовика, дерево посреди дороги. Такой винегрет снижает переобучение и учит сеть ловить суть, а не цепляться за случайные детали фона. Особенно полезен приём для детекторов и сегментации.

Как это работает интуитивно? Вы берёте четыре фото, делите каждое пополам и монтируете общий квадрат. Часть объектов обрезана краями ячеек, фон перемешан. Чтобы выдать ответ, модель анализирует целостный кадр и опирается на обрывки знаний. Постепенно она распознаёт предмет даже в неудобной позе, с обрезанным краем или в чужом окружении.

Пример. При обучении детектора для беспилотника на одном мозаичном кадре встречаются пешеход, кусок автобуса, знак и тротуар из разных съёмок. После тысяч таких комбинаций сеть найдёт пешехода даже в малой части кадра или среди веток. В реальности это разница между надёжным торможением и пропущенной угрозой.

Итог. Mosaic augmentation — дешёвый способ сделать модель устойчивее. Четыре картинки вместо одной дают больше, чем кажется: немного «перемешанной» реальности — и сеть заметно крепче в сложных сценах.