Transformer-XL
Обычный Transformer обрабатывает текст кусками и каждый раз «забывает» предыдущее — как будто книгу заменяют новой страницей без памяти о сюжете. Transformer-XL решает проблему с помощью скрытой памяти и умной связи между фрагментами. Модель работает как чтение с закладкой: использует сводку прошлых глав, не теряя причинно-следственные связи.
Технически это достигается двумя идеями. Первая — повторное использование скрытых состояний: при обработке нового куска модель подмешивает вычисления от предыдущего, формируя «резервуар» памяти. Вторая — относительное позиционное кодирование: вместо абсолютных номеров токенов оценивается расстояние между ними, что позволяет корректно склеивать фрагменты в связный поток.
Пример: предсказание следующего слова в детективе. Обычная модель, прочитав главу 20, забудет улику из главы 3. Transformer-XL сохраняет контекст и связывает детали, делая генерацию осмысленной на больших дистанциях.
Коротко: Transformer-XL — это «долговременная память» для нейросетей. Благодаря скрытой памяти и относительным позициям он преодолел главное ограничение Transformer, открыв путь к глубокому пониманию длинных данных.
Поделиться