WordPiece
Зачем это нужно? Языковые модели работают со словами как с числами. Целые слова раздувают словарь до миллионов записей, редкие слова запоминаются плохо. Одни буквы теряют смысловые связи и замедляют обучение. WordPiece даёт золотую середину: словарь из 30–100 тысяч подслов покрывает почти любой текст, включая опечатки и неологизмы.
Как работает? Алгоритм просматривает корпус текстов и считает частотность сочетаний. Начинает с букв, склеивает частые пары в более длинные фрагменты (слоги, корни), выбирая те, что улучшают предсказание текста. Остаются полезные кусочки: «ing», «er», «не». Редкое слово «антидискриминационный» разбивается на «анти», «дискримин», «аци», «онн», «ый» — и смысл понятен без заучивания целиком.
Прикладной пример: поиск. Запрос «подсвечники» разбивается на «под», «свеч», «ник», «и», что позволяет находить страницы со словами «свеча» и «подсвечник» без точного совпадения. Так же работают автоперевод, ассистенты, умные клавиатуры.
Коротко: WordPiece делит слова на умные кусочки, которые модель уже знает. Это делает ИИ гибким и устойчивым к новым словам, избавляя от гигантских словарей.
Поделиться