WordPiece
глоссарий

WordPiece

WordPiece

WordPiece — это алгоритм токенизации, который разбивает слова на подслова — частые фрагменты вроде «не», «понятн», «ый». Так ИИ понимает новые слова, собирая их из знакомых частей.

Зачем это нужно? Языковые модели работают со словами как с числами. Целые слова раздувают словарь до миллионов записей, редкие слова запоминаются плохо. Одни буквы теряют смысловые связи и замедляют обучение. WordPiece даёт золотую середину: словарь из 30–100 тысяч подслов покрывает почти любой текст, включая опечатки и неологизмы.

Как работает? Алгоритм просматривает корпус текстов и считает частотность сочетаний. Начинает с букв, склеивает частые пары в более длинные фрагменты (слоги, корни), выбирая те, что улучшают предсказание текста. Остаются полезные кусочки: «ing», «er», «не». Редкое слово «антидискриминационный» разбивается на «анти», «дискримин», «аци», «онн», «ый» — и смысл понятен без заучивания целиком.

Прикладной пример: поиск. Запрос «подсвечники» разбивается на «под», «свеч», «ник», «и», что позволяет находить страницы со словами «свеча» и «подсвечник» без точного совпадения. Так же работают автоперевод, ассистенты, умные клавиатуры.

Коротко: WordPiece делит слова на умные кусочки, которые модель уже знает. Это делает ИИ гибким и устойчивым к новым словам, избавляя от гигантских словарей.