глоссарий

Prompt cache

Prompt cache

Prompt cache — механизм, который запоминает вычисления для повторяющихся фрагментов входного текста модели. Без него каждый запрос заново перерабатывает одни и те же токены, например длинный системный промпт. С кэшем модель сохраняет готовое промежуточное состояние и мгновенно его подхватывает.

Это важно, потому что скорость и стоимость ответа зависят от длины входа. Для сервисов с тысячами запросов в минуту переиспользование вместо пересчёта экономит сотни долларов и снижает задержку. Prompt cache исключает двойную оплату за одну и ту же работу.

Как работает: каждый токен превращается в вектор через серию операций. Если те же токены встречались в том же порядке, их векторы идентичны, и кэш подставляет готовые значения. Но он срабатывает только при точном совпадении последовательности — любое изменение в середине промпта всё ломает, поэтому статичные инструкции выносят в начало.

Пример: сервис перевода медицинских документов с системным промптом на 1500 токенов. Без кэша каждый перевод оплачивает эти токены заново. С кэшем первый запрос считает их, остальные берут готовое состояние. Расходы на короткий документ падают в разы, скорость растёт.

Вывод: prompt cache — мощный инструмент оптимизации, делающий модели дешевле и быстрее без потери качества. Инженерам полезно понимать его, чтобы проектировать промпты эффективно, пользователи же получают более отзывчивые сервисы.