глоссарий

Semi-supervised learning

Semi-supervised learning

Полуобучающееся с учителем машинное обучение — это подход, при котором модель обучается на небольшом количестве размеченных данных и большом массиве неразмеченных. Разметка — это подписи, например «кошка» или «собака» для фотографий. Вручную размечать дорого и долго, а обычных картинок или текстов в интернете — миллионы. Этот метод позволяет использовать сырьё, которое и так лежит под рукой, экономя ресурсы экспертов.

Почему это важно? Классическое обучение с учителем требует огромных размеченных наборов, которые есть только у крупных компаний. Без маркировки модель не знает, что ей предсказывать. Полуобучение решает проблему дефицита: оно берёт маленькую точную выборку и «подтягивает» её за счёт структуры данных без ответов. Это резко снижает порог входа для стартапов и научных групп, а также повышает точность, когда разметка принципиально ограничена, например в медицине.

Работает это интуитивно так. Модель сначала учится на размеченных примерах, а затем смотрит на неразмеченные. Если рядом с известным «котом» лежит визуально похожее фото, алгоритм решает, что это тоже кот, добавляет его в свою базу знаний, переобучается и двигается дальше. Постепенно крошечное семя знаний прорастает через весь набор данных, используя естественные скопления и закономерности, подобно тому как человек догадывается о значении незнакомого слова по контексту.

Пример: сельское хозяйство. У вас есть дрон, снявший десять тысяч полей. Агроном вручную отметил лишь пятьдесят снимков с сорняками. Полуобучение ищет общие черты среди остальных девяти тысяч девятисот пятидесяти кадров, группирует их и выявляет, где сорняки, даже без подсказок. Итог — карта заражённых участков для точечной обработки гербицидами.

Итог: полуобучение — золотая середина между точной, но дорогой разметкой и дешёвым, но хаотичным сырьём. Оно делает ИИ доступнее в ситуациях, где качество важно, а разметки катастрофически мало. Для прикладных задач это часто самый практичный компромисс.