FixMatch
Разметка данных стоит дорого: например, для обучения модели распознаванию болезней по рентгеновским снимкам нужны часы работы врачей. Немаркированных изображений при этом миллионы. FixMatch позволяет использовать их бесплатно, достигая точности, сравнимой с полной разметкой, но при затратах в сто раз меньше.
Как это работает интуитивно. Модель получает два варианта одного изображения: слабо искажённый (чуть сдвинутый) и сильно искажённый (обрезанный, повёрнутый, с шумом). Сначала она смотрит на слабый вариант и делает предсказание. Если уверенность высокая — например, 98%, — этот ответ становится «псевдометкой», заданием для самой себя. Затем модель смотрит на сильно искажённый вариант и старается дать тот же ответ. Если получается — веса обновляются; если нет — пример отбрасывается. Контраст между лёгким и трудным вариантом заставляет модель выучивать устойчивые признаки, а не случайные шумы.
Пример из агротехники: стартап использует FixMatch для подсчёта сорняков на полях. Имея тысячу размеченных фотографий с дрона и сто тысяч без разметки, система достигает точности, почти не уступающей модели, обученной на десяти тысячах размеченных кадров. Фермеры экономят недели ручной работы.
Вывод: FixMatch — яркий пример эффективной работы с неразмеченными данными. Он не требует сложной архитектуры, легко внедряется, а его принцип — «учись на том, в чём уверен, и проверяй себя на трудных примерах» — стал стандартом для современных методов полусамообучения.
Поделиться