WordPiece
Зачем это важно? Модели машинного обучения не читают буквы, они оперируют числами. Каждому токену ставится в соответствие индекс из словаря. Но словарь не может вместить все слова языка — их миллионы, плюс постоянно появляются новые. Если же использовать только буквы, модель не поймёт смысла за пределами отдельных символов. WordPiece находит золотую середину: компактный словарь из десятков тысяч подслов покрывает практически любой текст.
Как это работает интуитивно? Представьте, что у вас есть груда кирпичей — букв. Сначала алгоритм считает, какие пары букв чаще встречаются вместе. Если пара «нн» встречается достаточно часто, он склеивает их в один кирпичик. Затем повторяет процесс: склеивает «по» и «нима», если это выгодно. Постепенно из мелких деталей собираются крупные блоки — частые слова и корни. Незнакомое слово, например «суперкалифраджилистик», не влезет в словарь, поэтому алгоритм разобьёт его на знакомые кусочки: «супер», «калифра», «джили», «стик». Так модель хотя бы примерно поймёт его состав.
Прикладной пример: представьте, что в медицинской статье встречается редкий термин «электроэнцефалография». В словаре BERT его нет. WordPiece превратит его в токены «электро», «энцефал», «о», «графия». Благодаря этому модель свяжет термин с известными словами «электричество» и «графика» и сможет обработать предложение без ошибок.
Итог: WordPiece — это умный компромисс между символами и целыми словами. Он позволяет ИИ работать с бесконечным разнообразием языка, используя ограниченный набор строительных блоков, и делает модели быстрее и точнее.
Поделиться