RetNet
У трансформеров фундаментальная проблема: при чтении длинного текста им нужно «держать в уме» все слова сразу, что требует огромных вычислительных затрат. Сложность растёт квадратично — в два раза длиннее текст, в четыре раза больше расчётов. RetNet же делает сложность линейной, поэтому может работать с гораздо более длинными текстами без катастрофического замедления. Это открывает путь к обработке целых книг или многолетней переписки без потери контекста.
Интуитивно RetNet работает как человек, конспектирующий лекцию: вместо дословной записи сохраняются ключевые мысли, а неважные детали постепенно затухают. Сеть хранит не все слова, а сжатое состояние — «конспект». Каждое новое слово обновляет его, причём старые фрагменты влияют всё слабее — это и есть удержание. При этом механизм позволяет параллельно обучаться, как трансформер, а при генерации текста работать последовательно, экономя память.
Прикладной пример — перевод длинного юридического документа. Трансформер с квадратичной сложностью упрётся в лимит контекста, и начало документа будет забыто. RetNet же обработает документ целиком, сохраняя важные определения из первых страниц при переводе последних. Или нейросеть анализирует историю болезней пациента за сорок лет: RetNet выявит редкие закономерности, которые затерялись бы в сотнях записей.
Вывод: RetNet — это шаг к более эффективным и масштабным языковым моделям, которые лучше понимают длинный контекст и экономят ресурсы. Это не замена всех архитектур, но мощная альтернатива для задач, где решающим становится удержание информации во времени.
Поделиться