глоссарий

NVMe KV cache

NVMe KV cache

NVMe KV cache — это технология хранения промежуточных вычислений нейросети на скоростном твердотельном диске. В больших языковых моделях каждое слово превращается в пары «ключ-значение», которые описывают его связь с остальным текстом. Раньше такие пары держали только в оперативной памяти, но она дорогая, а её объём ограничен. NVMe-накопители стоят дешевле и при этом очень быстрые, поэтому кэш можно сделать огромным — до сотен гигабайт.

Зачем это важно? Без кэша при каждом новом обращении модель вынуждена заново пересчитывать все предыдущие слова диалога. Это тратит время, электроэнергию и деньги компании. С NVMe KV cache уже посчитанные ключи и значения лежат на диске, и когда пользователь пишет следующее сообщение, модель просто загружает их оттуда, а не выполняет ту же работу повторно. В итоге сервис отвечает быстрее и обходится дешевле.

Как это работает интуитивно? Представьте, что вы читаете книгу и на полях записываете краткое содержание каждой главы. Когда нужно вспомнить детали, вы заглядываете в записи, а не перечитываете весь том. Так и модель: для каждого токена она делает «заметки» — ключи и значения. NVMe KV cache сохраняет эти заметки на быстрый диск. При следующем запросе они считываются за доли секунды, потому что интерфейс NVMe оптимизирован для параллельного доступа и имеет огромную скорость передачи данных.

Прикладной пример — виртуальный ассистент, который помнит историю переписки за неделю. Без кэша каждое новое сообщение заставляло бы его обрабатывать тысячи предыдущих слов заново, и ответ приходил бы с заметной задержкой. С NVMe KV cache история хранится на накопителе, и ассистент мгновенно извлекает нужный контекст, поэтому пользователь получает ответ почти сразу.

Краткий итог: NVMe KV cache — это мост между дорогой оперативной памятью и медленными дисками. Он позволяет языковым моделям работать быстро и не разоряться на память, делая современные ИИ-сервисы доступными для всех.