Prompt cache
Это важно, потому что скорость и стоимость ответа зависят от длины входа. Для сервисов с тысячами запросов в минуту переиспользование вместо пересчёта экономит сотни долларов и снижает задержку. Prompt cache исключает двойную оплату за одну и ту же работу.
Как работает: каждый токен превращается в вектор через серию операций. Если те же токены встречались в том же порядке, их векторы идентичны, и кэш подставляет готовые значения. Но он срабатывает только при точном совпадении последовательности — любое изменение в середине промпта всё ломает, поэтому статичные инструкции выносят в начало.
Пример: сервис перевода медицинских документов с системным промптом на 1500 токенов. Без кэша каждый перевод оплачивает эти токены заново. С кэшем первый запрос считает их, остальные берут готовое состояние. Расходы на короткий документ падают в разы, скорость растёт.
Вывод: prompt cache — мощный инструмент оптимизации, делающий модели дешевле и быстрее без потери качества. Инженерам полезно понимать его, чтобы проектировать промпты эффективно, пользователи же получают более отзывчивые сервисы.
Поделиться