Tokens per second
глоссарий

Tokens per second

Tokens per second

«Tokens per second» — это скорость, с которой модель искусственного интеллекта генерирует текст. Один токен — примерно часть слова, часто слог или даже целое короткое слово. Показатель измеряет, сколько таких фрагментов нейросеть выдаёт за секунду.

Зачем об этом знать? Скорость генерации напрямую определяет, насколько быстро вы получите ответ. Если модель выдаёт 10 токенов в секунду, длинный абзац будет появляться медленно, с паузами. Если 100 — текст словно «выстреливает» мгновенно. Для чат-ботов и редакторов этот параметр так же важен, как частота кадров для видеоигры.

Как это работает интуитивно? Представьте, что модель пишет на печатной машинке, но не по буквам, а блоками. Сначала она анализирует предыдущие слова, потом выбирает наиболее вероятный следующий фрагмент. Чем тяжелее модель и сложнее запрос, тем дольше она «думает», и тем медленнее появляются токены. Быстрые модели уступают в глубине рассуждений, а медленные — в отзывчивости.

Прикладной пример: вы общаетесь с ассистентом для написания кода. При скорости 30 токенов в секунду подсказки возникают плавно, и вы успеваете их прочитать. Если скорость падает до 5, каждая строка появляется с задержкой, работа превращается в ожидание.

Вывод: «Tokens per second» — это простой показатель отзывчивости нейросети. Чем он выше, тем комфортнее взаимодействие, но ради скорости часто приходится жертвовать качеством сложных ответов.