Pseudo-labeling
Это важно, потому что в реальности размеченных данных мало: разметка требует времени и денег экспертов. Например, врач вручную описывает тысячи снимков, а неразмеченных — миллионы. Псевдоразметка позволяет задействовать этот ресурс, повышая точность модели без затрат на людей.
Интуитивно: модель обучается на небольшом размеченном наборе, затем проходит по неразмеченным данным и для каждого примера выдает уверенность — например, «95%, что на фото кот». Если уверенность высокая, предсказание становится псевдометкой, пример добавляется в обучающую выборку. Модель переобучается на расширенном наборе, снова предсказывает, отбирает уверенные псевдометки — цикл повторяется. Это как ученик, который решает тест, сверяет только легкие задания и учится на них.
Пример: в задаче распознавания эмоций есть тысяча размеченных отзывов и сто тысяч без разметки. Модель обучается на тысяче, предсказывает эмоции для остальных, выбирает предсказания с вероятностью выше 0,9, добавляет их в обучение и повторяет. Так она осваивает новые формулировки и жаргон, которых не было в исходных данных.
Вывод: псевдоразметка — простой мощный способ использовать неразмеченные данные, но требует осторожности. Высокий порог уверенности снижает пользу, низкий — ведет к накоплению ошибок, когда модель учится на собственных заблуждениях. Поэтому отбирать нужно только очень уверенные предсказания и при необходимости фильтровать их дополнительными правилами.
Поделиться