Tokens per second
Зачем это знать? При общении с чат-ботом или автодополнении кода именно скорость решает, ждать результат секунды или минуты. Токены в секунду — главная метрика производительности для практиков. На неё смотрят при выборе модели, настройке серверов и покупке видеокарт. Медленная генерация делает даже умную модель непригодной для диалога в реальном времени.
Как это понять интуитивно? Представьте, что модель печатает на огромной машинке не буквами, а блоками — слогами или частями слов. Каждый блок требует сложных вычислений: оцениваются вероятности всех возможных следующих токенов и выбирается лучший. Поэтому скорость зависит от мощности железа, размера модели и длины контекста. Короткие токены дают больше токенов в секунду, но меньше символов — сравнивать модели корректно только на одинаковых данных.
Пример: модель генерирует 50 токенов в секунду. Если токен в среднем 4 символа, за секунду выходит около 200 символов, примерно 3 предложения. Это комфортно для чата. При падении до 5 токенов в секунду ответ на 500 символов будет идти 25 секунд — для живого общения непригодно, но для фоновой обработки документов сгодится.
Итог: tokens per second — это «скорость мысли» модели в цифрах. Умение её интерпретировать помогает отличать быстрые системы от едва живых. Когда ИИ отвечает за доли секунды, этот показатель важнее количества параметров.
Поделиться