Span corruption
Такой подход учит модель схватывать глобальные связи, а не опираться на соседние слова. Модели вроде T5, обученные на span corruption, лучше справляются с переформулировкой: суммаризацией, переводом, ответами на вопросы. Вместо запоминания локальных закономерностей модель строит внутреннее представление смысла текста.
Интуитивно это работает так: представьте, что в книге замазали длинную фразу. По буквам слева и справа её не восстановить — нужно понять тему абзаца, логику рассуждения и лишь затем предложить вариант. Модель видит текст с маской, анализирует его целиком и генерирует наиболее вероятную пропущенную последовательность.
Классический пример — автоматическое реферирование. Статью подают с вырезанным предложением, модель восстанавливает его и на этом опыте учится строить краткие пересказы: она уже умеет по контексту догадываться о недостающей части. В итоге для суммаризации и перевода модель даёт более осмысленные результаты, чем при угадывании отдельных слов.
Итак, span corruption — это способ улучшить модель за счёт «умного» задания: восстанавливать целые фрагменты, а не точечные пробелы. Такой подход делает модели глубже и устойчивее в реальных текстовых задачах.
Поделиться