глоссарий

PagedAttention

PagedAttention

PagedAttention — это метод управления памятью в больших языковых моделях. Чтобы отвечать, модель должна удерживать в памяти весь предыдущий контекст: чем длиннее диалог, тем больше ресурсов требуется. Без умной организации это вызывает замедление и сбои. PagedAttention решает проблему, разбивая «слепок» внимания на небольшие блоки-страницы — по аналогии с виртуальной памятью в операционной системе.

Технология критична для чат-ботов и ассистентов: они работают за счёт запоминания реплик. Неэффективное хранение контекста замедляет ответы и удорожает серверы. PagedAttention снижает расход памяти, позволяя обслуживать больше пользователей на одном устройстве и ускоряя генерацию. Это одна из «скрытых» технологий, сделавших ChatGPT и аналогичные сервисы доступными миллионам.

Интуитивно это работает как библиотека, где книга разобрана на главы, которые поднимают в читальный зал по мере надобности. При обработке нового слова модели нужно «просмотреть» предыдущие, но не все одинаково важны. PagedAttention хранит ключи и значения внимания отдельными страницами и загружает только релевантные текущему моменту. Разные ветки диалога могут разделять одни и те же страницы, как читатели — один экземпляр книги.

Пример: вы обсуждаете с ассистентом поездку — сначала рейсы, потом отели, погоду, а затем возвращаетесь к багажу. Без PagedAttention система держала бы всю переписку как один тяжёлый массив. С ней каждая тема хранится отдельным блоком. На вопрос о багаже модель подгружает только страницы с деталями перелёта, игнорируя отели и погоду.

В итоге PagedAttention — незаметная, но важнейшая инженерная находка. Она делает диалог с ИИ быстрым и плавным даже при длинных беседах. Без неё современные модели были бы дороже в эксплуатации и отвечали заметно медленнее — технология напрямую влияет на наш повседневный опыт общения с искусственным интеллектом.