глоссарий

Noisy student

Noisy student

Представьте школьника, который учится не по учебнику, а по конспектам своих одноклассников. Конспекты эти неидеальны: в них есть ошибки и пропуски. Но именно вынужденная борьба с чужими ошибками заставляет школьника лучше понять предмет. Примерно так работает метод «Noisy student» (шумный ученик) в искусственном интеллекте.

Это техника самообучения, где одна модель ИИ («учитель») обучает другую («ученика») на размеченных данных. Хитрость в том, что ученику специально добавляют «шум» — случайные искажения во входных данных, такие как обрезка изображений, искажение звука или отключение части нейронов. Учитель учится на чистом, хорошо размеченном наборе данных. Затем он «размечает» большой массив неразмеченных данных — попросту говоря, ставит на них свои предположительные ответы. На этих «грязных» данных, где есть и правильная разметка, и предположения учителя, и живет ученик.

Зачем это нужно? Главная проблема ИИ — потребность в огромных массивах размеченных данных, которые собирают вручную люди. Это дорого и медленно. Метод «шумного ученика» позволяет использовать дешевые неразмеченные данные, достигая при этом точности, сопоставимой с моделями, обученными человеком. Интуитивно это работает так: шум не дает ученику слепо зазубрить ответы. Чтобы игнорировать помехи, ему приходится выявлять более глубокие, базовые закономерности в данных. Он учится обобщать, а не запоминать.

Вот реальный пример из распознавания речи. Небольшая модель переводит речь в текст, обучаясь на коротких диалогах. Затем она «надиктовывает» тысячи часов видео без субтитров, создавая черновые подписи. На этих данных, смешанных с шумом и ошибками авторазметки, обучается новая модель. Она превосходит учителя, потому что видела гораздо более разнообразную речь. Вывод: добавляя «шум», мы делаем ИИ проницательнее, учим его видеть суть за искажениями.