глоссарий

Transformer-XL

Transformer-XL

Transformer-XL — это архитектура для работы с очень длинными последовательностями (тексты, музыка). В отличие от классического Transformer, где память ограничена фиксированным окном, XL сохраняет контекст на сотни тысяч токенов. Это важно для анализа романов, прогнозирования временных рядов и генерации длинных статей.

Обычный Transformer обрабатывает текст кусками и каждый раз «забывает» предыдущее — как будто книгу заменяют новой страницей без памяти о сюжете. Transformer-XL решает проблему с помощью скрытой памяти и умной связи между фрагментами. Модель работает как чтение с закладкой: использует сводку прошлых глав, не теряя причинно-следственные связи.

Технически это достигается двумя идеями. Первая — повторное использование скрытых состояний: при обработке нового куска модель подмешивает вычисления от предыдущего, формируя «резервуар» памяти. Вторая — относительное позиционное кодирование: вместо абсолютных номеров токенов оценивается расстояние между ними, что позволяет корректно склеивать фрагменты в связный поток.

Пример: предсказание следующего слова в детективе. Обычная модель, прочитав главу 20, забудет улику из главы 3. Transformer-XL сохраняет контекст и связывает детали, делая генерацию осмысленной на больших дистанциях.

Коротко: Transformer-XL — это «долговременная память» для нейросетей. Благодаря скрытой памяти и относительным позициям он преодолел главное ограничение Transformer, открыв путь к глубокому пониманию длинных данных.