глоссарий

Medusa

Medusa

Медуза — метод ускорения больших языковых моделей, которые обычно генерируют текст по одному слову за раз. Вместо последовательного ожидания каждого слова «Медуза» добавляет к модели дополнительные «головы», предсказывающие сразу несколько следующих слов. Подход предложен в 2023 году и стал популярным ускорителем инференса без потери качества.

Зачем это нужно? Чат-боты работают в реальном времени, а каждая задержка ухудшает впечатление. Последовательная генерация токенов — узкое место: на абзац уходят сотни шагов, каждый занимает время. «Медуза» сокращает число шагов в разы, что критично для нагруженных сервисов и устройств с ограниченными ресурсами.

Как это работает? Представьте художника, который пишет маслом, где каждый мазок — слово. Обычная модель делает мазок, смотрит, затем следующий. «Медуза» делает быстрый набросок углём — предсказывает сразу несколько слов — и сверяет его с исходной моделью. Если набросок верен, он принимается целиком; если есть ошибка, исправляются только ошибочные части. Это называется «дребезжащее декодирование» и похоже на черновик, проверяемый опытным редактором.

Пример: мобильный помощник с ответом «Поверните направо у парка, затем через 200 метров налево» без «Медузы» отвечает около секунды, с ней — за 0,3 секунды, предсказывая три-четыре слова за раз. Пользователь не успевает задуматься, не завис ли бот. Архитектуру не нужно переучивать с нуля: головы обучаются отдельно поверх готовой модели.

Кратко: «Медуза» ускоряет модели через простую идею «предскажи больше, потом проверь». Она не меняет смысл ответов, но делает их почти мгновенными, приближая ИИ к естественному темпу общения.