Draft model
Зачем это нужно? Современные большие языковые модели отвечают не мгновенно, потому что каждый новый токен требует сложных вычислений. В диалоговых сервисах, поисковиках и сервисах перевода задержка сильно портит впечатление. Draft model позволяет сократить время ожидания в разы, сохраняя при этом почти такое же качество, как у полной модели. Вместо того чтобы заставлять «тяжёлую» нейросеть придумывать каждое слово с нуля, ей дают готовый вариант, с которым она соглашается или который уточняет.
Интуитивно это похоже на работу редактора с автором. Автор — это маленькая, шустрая модель, которая быстро пишет текст, не слишком задумычиваясь. Редактор — большая модель, которая не сидит и не сочиняет, а читает готовый черновик, вычёркивает неудачные места и вписывает свои правки. Такой подход работает благодаря тому, что большая модель может обрабатывать сразу несколько предложенных вариантов параллельно и выбирать лучший. В итоге скорость резко растёт, а качество почти не страдает.
Классический пример — чат-бот на базе большой модели. Без draft model каждое слово генерировалось бы за несколько миллисекунд, и ответ на длинный вопрос занимал бы несколько секунд. С черновой моделью ответ появляется почти мгновенно, как будто бот думает на лету. Пользователь этого не замечает, но разница в скорости огромна. В итоге draft model — это невидимый ускоритель, который делает большие языковые модели практичными для реального использования, оставаясь полностью незаметным для обычного человека.
Поделиться