глоссарий

Span corruption

Span corruption

Span corruption — приём обучения языковых моделей: из текста вырезают случайный непрерывный кусок, заменяют маской и просят модель восстановить его целиком. В отличие от маскирования отдельных слов, пропадает целый фрагмент — от пары слов до предложения, — и нужно угадать всю последовательность.

Такой подход учит модель схватывать глобальные связи, а не опираться на соседние слова. Модели вроде T5, обученные на span corruption, лучше справляются с переформулировкой: суммаризацией, переводом, ответами на вопросы. Вместо запоминания локальных закономерностей модель строит внутреннее представление смысла текста.

Интуитивно это работает так: представьте, что в книге замазали длинную фразу. По буквам слева и справа её не восстановить — нужно понять тему абзаца, логику рассуждения и лишь затем предложить вариант. Модель видит текст с маской, анализирует его целиком и генерирует наиболее вероятную пропущенную последовательность.

Классический пример — автоматическое реферирование. Статью подают с вырезанным предложением, модель восстанавливает его и на этом опыте учится строить краткие пересказы: она уже умеет по контексту догадываться о недостающей части. В итоге для суммаризации и перевода модель даёт более осмысленные результаты, чем при угадывании отдельных слов.

Итак, span corruption — это способ улучшить модель за счёт «умного» задания: восстанавливать целые фрагменты, а не точечные пробелы. Такой подход делает модели глубже и устойчивее в реальных текстовых задачах.