глоссарий

ALiBi

ALiBi

ALiBi расшифровывается как Attention with Linear Biases — «внимание с линейными смещениями». Это простой приём, который помогает большим языковым моделям учитывать порядок слов. Без указания позиций нейросеть воспринимала бы «кот укусил собаку» и «собака укусила кота» как одинаковые наборы токенов. Обычно для этого используют позиционное кодирование.

Главное преимущество ALiBi — эффективность и способность к экстраполяции. Модель может работать с текстами длиннее тех, на которых обучалась, без резкой потери качества. Старые методы (синусоидальные кодировки, обучаемые эмбеддинги) при удлинении текста «теряли нить» — внимание расплывалось. ALiBi же плавно продолжает рассуждения на незнакомой длине, что важно для документов, статей и переписки.

Интуитивно это работает так: модель оценивает смысловую связь между словами, а ALiBi добавляет к оценке поправку — чем дальше слово от текущего, тем больше вычитается из его важности. Поправка растёт линейно, без сложных вычислений и дополнительных обучаемых параметров. Поэтому модель работает быстрее и требует меньше памяти.

Пример: чат-бот на ALiBi обрабатывает длинный диалог из сотни сообщений. Старые модели часто забывали начало беседы, путая контекст. Линейные смещения сохраняют фокус на ключевых деталях, и бот отвечает связно, не теряя мысль. В итоге ALiBi — изящный способ научить нейросеть чувствовать расстояние между словами, делая модели длиннее, дешевле и устойчивее к неожиданной длине текста.