глоссарий

Tokens per second

Tokens per second

Токены в секунду — единица измерения скорости больших языковых моделей. Токен — это не слово и не буква, а фрагмент текста: часть слова или несколько символов. Например, «нейросеть» может быть разбито на два токена. Показатель показывает, сколько таких кусочков модель генерирует за секунду. Чем выше — тем быстрее ответ.

Зачем это знать? При общении с чат-ботом или автодополнении кода именно скорость решает, ждать результат секунды или минуты. Токены в секунду — главная метрика производительности для практиков. На неё смотрят при выборе модели, настройке серверов и покупке видеокарт. Медленная генерация делает даже умную модель непригодной для диалога в реальном времени.

Как это понять интуитивно? Представьте, что модель печатает на огромной машинке не буквами, а блоками — слогами или частями слов. Каждый блок требует сложных вычислений: оцениваются вероятности всех возможных следующих токенов и выбирается лучший. Поэтому скорость зависит от мощности железа, размера модели и длины контекста. Короткие токены дают больше токенов в секунду, но меньше символов — сравнивать модели корректно только на одинаковых данных.

Пример: модель генерирует 50 токенов в секунду. Если токен в среднем 4 символа, за секунду выходит около 200 символов, примерно 3 предложения. Это комфортно для чата. При падении до 5 токенов в секунду ответ на 500 символов будет идти 25 секунд — для живого общения непригодно, но для фоновой обработки документов сгодится.

Итог: tokens per second — это «скорость мысли» модели в цифрах. Умение её интерпретировать помогает отличать быстрые системы от едва живых. Когда ИИ отвечает за доли секунды, этот показатель важнее количества параметров.