глоссарий

Mask R-CNN

Mask R-CNN

Mask R-CNN — алгоритм компьютерного зрения, который не просто находит объекты, а выделяет их точные контуры. Вместо прямоугольной рамки вокруг кота он создаёт маску в форме кота, включая уши и хвост. Это важно там, где нужно знать не только что перед нами, но и где именно заканчивается объект.

Для человека границы предметов очевидны, для машины — сложная задача. Рамка груба: в неё попадает фон, а перекрывающиеся объекты сливаются. Пиксельная маска отделяет человека от велосипеда, руку от стола, здоровую ткань от опухоли. Без этого невозможны точное взаимодействие робота с миром или аккуратный фоторедактор, где нужен силуэт, а не квадрат.

Как это работает? Сеть сначала находит области, где могут быть объекты, и предсказывает для каждой границу и класс. Но у Mask R-CNN есть дополнительная ветвь — «маска». Маленькая свёрточная сеть для каждого пикселя внутри рамки определяет, принадлежит ли он объекту. Миллионы таких решений складываются в цельную картинку. Хитрость в том, что маска предсказывается параллельно с рамкой, а не после, — это экономит время и повышает точность.

Пример: врач смотрит снимок МРТ. Mask R-CNN не просто говорит «вот здесь что-то есть», а обводит новообразование по контуру и рассчитывает его площадь и объём. Так видно динамику роста опухоли: даже смещение на миллиметр отражается в изменении маски. Технология применяется в беспилотных автомобилях, чтобы разделить пешехода и его тень, и в сельском хозяйстве — для подсчёта спелых ягод на кусте.

Итог: Mask R-CNN — мост между грубым «увидел» и точным «понял, где именно». Она превращает компьютерное зрение из угадайки с рамками в ювелирную работу с формами. Машины видят мир не как набор прямоугольников, а как мозаику силуэтов, что приближает их к человеческому восприятию.