глоссарий

Unigram tokenizer

Unigram tokenizer

Unigram tokenizer — это алгоритм разбиения текста на токены, минимальные смысловые единицы. Он работает как взвешенная лотерея: у каждого кусочка («не», «бо», «ль») есть свой шанс, а система выбирает комбинацию, которая даёт наибольшую суммарную вероятность для всего предложения. Проще говоря, это способ понять, как лучше «порезать» слова на фрагменты, сохраняя смысл.

Зачем это нужно? Модели не читают текст целиком — им нужны компактные блоки. Если резать по словам, словарь станет огромным, а редкие слова исчезнут. Если по буквам — слишком много вычислений. Unigram находит золотую середину: он сам определяет границы по частотности в обучающих данных. Благодаря этому модель понимает незнакомые слова, собирая их из знакомых кусочков, и экономит память.

Как это работает? Представьте конструктор: есть кубики разной длины — «маш», «шин», «ное», «обу», «чение». Алгоритм перебирает варианты разбиения и выбирает тот, где сумма весов кубиков (их частот) максимальна. Затем он несколько раз убирает самые редкие кубики, пока не останется оптимальный набор. Это похоже на шлифовку: лишнее отсекается, нужное остаётся.

Пример: переводчик встречает слово «нейросеть». Модель не знает его целиком, но Unigram делит на «нейро» и «сеть» — оба кусочка частые в словаре. Перевод получается корректным. Без токенизатора пришлось бы игнорировать слово или обращаться к серверу.

Итог: Unigram tokenizer — гибкий инструмент, который помогает ИИ работать с языком экономно и осмысленно, балансируя между скоростью и пониманием. Это один из ключевых компонентов современных языковых моделей.