Instance segmentation
Обычное распознавание понимает, что на фото есть человек, автомобиль и дерево. Семантическая сегментация красит всех людей в один цвет. А инстанс-сегментация различает три разные машины, четыре человека и пять деревьев — даже если они перекрывают друг друга. Это нужно роботам, беспилотникам, медицине и анализу видео, где объекты важны не как класс, а как уникальные сущности.
Как это работает интуитивно? Сеть сначала находит сотни потенциальных областей-кандидатов с помощью алгоритмов поиска контуров. Затем для каждой области классификатор решает, что это за объект, а специальная маска-ветвь уточняет границу пиксель за пикселем. Чтобы не плодить одинаковые предсказания, применяется подавление: если две рамки сильно перекрываются, сеть оставляет ту, что увереннее. В итоге каждый пиксель изображения либо принадлежит одному «экземпляру», либо фону.
Пример прикладной: автономный магазин с камерами на потолке. Инстанс-сегментация видит, кто из покупателей взял с полки конкретный «Твикс», а кто — «Сникерс», и автоматически формирует чек в телефоне. Без неё камера поняла бы лишь, что «люди берут продукты», но не смогла бы отделить одну пачку от другой.
Вывод. Инстанс-сегментация — это «индивидуальный подход» в компьютерном зрении: она переводит наше умение видеть классы на уровень отдельных объектов, открывая дорогу точной автоматизации в реальном мире.
Поделиться