глоссарий
Prefill
Prefill — это первый этап работы большой языковой модели, когда она обрабатывает весь ваш запрос целиком, а не по одному слову. Если генерация ответа похожа на медленное проговаривание фразы, то префилл — это мгновенное чтение условия задачи. Название из английского: pre «заранее» и fill «заполнять» — модель заполняет внутреннюю память смыслом запроса. Понимать префилл важно, потому что от него зависит время до первого токена — то самое, что пользователь ощущает как скорость ответа. Интуитивно это работает так. Сетка внимания модели смотрит на все слова вопроса одновременно и вычисляет для каждого некое «резюме» — вектор, учитывающий и само слово, и его связи с соседями. Эти векторы складываются в специальный кэш. Во время генерации модель добавляет по одному слову и лишь сверяется с готовым кэшем, а не перечитывает вопрос. Представьте, что готовите сложное блюдо: префилл — это заранее нарезанные ингредиенты, а генерация — жарка. Без подготовки пришлось бы резать овощи между помешиванием. Прикладной пример: в сервисе перевода вы вводите длинное английское предложение. Пока вы жмёте «перевести», префилл обрабатывает все токены параллельно за несколько миллисекунд. Затем модель выдаёт перевод слово за словом, и первое слово вы видите почти мгновенно. Вывод простой: префилл — невидимый, но критический ускоритель. Именно он позволяет моделям отвечать плавно, а не заставлять вас ждать по десять секунд.
Поделиться