глоссарий

WordPiece

WordPiece

WordPiece — это алгоритм токенизации, то есть способ разбивать текст на минимальные смысловые единицы — токены. В отличие от простого деления по пробелам, WordPiece работает на уровне подслов: знакомые слова остаются целыми, а редкие или неизвестные разбиваются на части. Именно так устроены знаменитые нейросети BERT или DistilBERT.

Зачем это важно? Модели машинного обучения не читают буквы, они оперируют числами. Каждому токену ставится в соответствие индекс из словаря. Но словарь не может вместить все слова языка — их миллионы, плюс постоянно появляются новые. Если же использовать только буквы, модель не поймёт смысла за пределами отдельных символов. WordPiece находит золотую середину: компактный словарь из десятков тысяч подслов покрывает практически любой текст.

Как это работает интуитивно? Представьте, что у вас есть груда кирпичей — букв. Сначала алгоритм считает, какие пары букв чаще встречаются вместе. Если пара «нн» встречается достаточно часто, он склеивает их в один кирпичик. Затем повторяет процесс: склеивает «по» и «нима», если это выгодно. Постепенно из мелких деталей собираются крупные блоки — частые слова и корни. Незнакомое слово, например «суперкалифраджилистик», не влезет в словарь, поэтому алгоритм разобьёт его на знакомые кусочки: «супер», «калифра», «джили», «стик». Так модель хотя бы примерно поймёт его состав.

Прикладной пример: представьте, что в медицинской статье встречается редкий термин «электроэнцефалография». В словаре BERT его нет. WordPiece превратит его в токены «электро», «энцефал», «о», «графия». Благодаря этому модель свяжет термин с известными словами «электричество» и «графика» и сможет обработать предложение без ошибок.

Итог: WordPiece — это умный компромисс между символами и целыми словами. Он позволяет ИИ работать с бесконечным разнообразием языка, используя ограниченный набор строительных блоков, и делает модели быстрее и точнее.