глоссарий

Masked language modeling

Masked language modeling

Маскированное языковое моделирование — это один из ключевых приёмов обучения современных языковых нейросетей, таких как BERT. Его суть предельно проста: модель показывают текст, в котором часть слов случайно заменена специальной маской, например [MASK], и просят восстановить пропуски по контексту. Это похоже на школьное упражнение «вставьте пропущенное слово», только в гигантском масштабе.

Зачем это нужно? Дело в том, что обычные языковые модели учатся предсказывать следующее слово, глядя только на предыдущие. Но для понимания смысла важно учитывать и слова, которые идут после пропуска. Маскированное моделирование заставляет нейросеть анализировать предложение целиком, с двух сторон сразу. В результате модель усваивает не просто порядок слов, а глубокие связи между ними, что критично для задач, требующих понимания, а не генерации текста.

Представьте, что вы читаете записку: «Он не смог заснуть, потому что [MASK] светила в окно». Вы легко догадаетесь, что пропущена «луна», хотя до пропуска об этом ничего не сказано. Нейросеть делает то же самое, но на миллионах предложений. В процессе таких упражнений она вырабатывает векторные представления слов, в которых учтён их смысл в конкретном окружении. Например, слово «банк» в предложении про реку и в предложении про деньги получит разные векторы.

Прикладной пример — поиск по смыслу в больших документах. Если вы ищете «как приготовить гречку», а в тексте сказано «довести крупу до готовности», то модель, обученная с маскированием, поймёт, что «гречка» и «крупа» здесь взаимозаменяемы, и выдаст нужный результат. Без такого обучения поиск распознал бы только дословные совпадения.

Итак, маскированное языковое моделирование — это способ научить ИИ понимать контекст, а не просто запоминать слова. Именно оно лежит в основе большинства современных систем анализа текста, от поисковиков до умных ассистентов.