Unigram tokenizer
Зачем это нужно? Модели не читают текст целиком — им нужны компактные блоки. Если резать по словам, словарь станет огромным, а редкие слова исчезнут. Если по буквам — слишком много вычислений. Unigram находит золотую середину: он сам определяет границы по частотности в обучающих данных. Благодаря этому модель понимает незнакомые слова, собирая их из знакомых кусочков, и экономит память.
Как это работает? Представьте конструктор: есть кубики разной длины — «маш», «шин», «ное», «обу», «чение». Алгоритм перебирает варианты разбиения и выбирает тот, где сумма весов кубиков (их частот) максимальна. Затем он несколько раз убирает самые редкие кубики, пока не останется оптимальный набор. Это похоже на шлифовку: лишнее отсекается, нужное остаётся.
Пример: переводчик встречает слово «нейросеть». Модель не знает его целиком, но Unigram делит на «нейро» и «сеть» — оба кусочка частые в словаре. Перевод получается корректным. Без токенизатора пришлось бы игнорировать слово или обращаться к серверу.
Итог: Unigram tokenizer — гибкий инструмент, который помогает ИИ работать с языком экономно и осмысленно, балансируя между скоростью и пониманием. Это один из ключевых компонентов современных языковых моделей.
Поделиться