Токен
Деление на токены нужно для компактности. Вместо хранения миллионов слов модель использует «кирпичики» — корни, приставки, суффиксы. Даже встречая незнакомое слово, она собирает его из известных частей, например «пере-», «-лет-», «-еть» для «перелететь». Это делает ИИ гибким и экономным.
Процесс похож на чтение записки по слогам: модель последовательно обрабатывает токены, учитывая контекст соседних единиц. Чем длиннее цепочка токенов, тем больше «памяти» у модели, но и тем дольше ответ. Поэтому количество токенов — единица измерения длины диалога (например, лимит 4096 токенов).
На практике вы пишете «Какая сегодня погода?», модель разбивает на токены примерно так: «Какая», «сегодня», «погода», «?». Если убрать пробелы, механизм может сбиться. Современные модели (GPT-4, YandexGPT) используют BPE — алгоритм, где токены — наиболее частые последовательности символов в обучающих текстах. Пробел тоже считается токеном, иначе «кошка» и «кошка.» были бы разными единицами.
Итог: токен — настраиваемая единица, балансирующая между компактностью и точностью. Когда вы платите за API или видите ограничение длины, речь идёт именно о токенах. Это объясняет, почему модели «забывают» начало длинного разговора и почему одно слово может стоить два токена. Токенизация — фундамент работы с текстом в ИИ.
Поделиться