глоссарий

Attention sink

Attention sink

Attention sink — это явление в больших языковых моделях, когда значительная доля «внимания» застревает на начальных токенах текста, особенно на служебных символах вроде первого пробела. Модель как бы прилипает к первым словам, даже когда смысл контекста уже далеко впереди.

Этот эффект важен, потому что он напрямую влияет на качество работы и способность обрабатывать длинные тексты. Если модель тратит ресурсы на «глядение» в начало, она хуже улавливает связи между поздними частями. Понимание этого позволяет инженерам исправлять проблему через тренировочные приёмы или архитектурные модификации, делая модели точнее и стабильнее.

Интуитивно это похоже на человека, который при чтении длинного документа постоянно поглядывает на оглавление на первой странице, даже когда уже читает главу двадцатую. Модель выучила, что первые токены всегда присутствуют, и использует их как «якорь» для нормализации вычислений. Это не осознанный выбор, а артефакт обучения: ей проще сбрасывать туда часть «лишнего» внимания, чем аккуратно распределять его по всему контексту.

Прикладной пример — чат-бот с диалогом на пятьдесят сообщений: модель может ухудшить понимание последних реплик, потому что часть внимания утекает в начало системного промпта. Инженеры замечают это по «пустым» токенам вроде символа новой строки и добавляют в начала текстов специальные обучающие сигналы, чтобы перенаправить внимание на актуальные части беседы.

Короткий вывод: attention sink — это не ошибка, а побочный эффект обучения нейросетей, который нужно понимать и контролировать. Зная о нём, разработчики строят более надёжные системы, которые действительно следят за всей беседой, а не застревают на вступлении. Это один из тех маленьких, но критичных нюансов, что отделяют игрушечную демонстрацию от настоящего промышленного инструмента.