Subword
Зачем это нужно? Словарь только из целых слов не охватывает редкие термины, имена, неологизмы и опечатки. Работа с отдельными символами слишком затратна: слово из десяти букв требует десяти шагов обработки. Субслова — золотая середина: частотные слова остаются целыми, а редкие и новые разбиваются на знакомые части.
Как это работает? Модель заранее учит список частых фрагментов, например «не», «перевод», «имый». Встретив слово «непереводимый», она складывает его из известных кусочков. Если слово уникальное, вроде «криптонейросеть», модель разобьёт его на «крипто» и «нейросеть», которые уже видела. Так словарь не раздувается, а модель остаётся гибкой.
Пример — машинный перевод. Встретив редкий термин «квантовый компьютер», модель, знающая только целые слова, может перевести его искажённо. Субсловная модель распознаёт «квантов» и «компьютер» по отдельности, даже если точное сочетание раньше не встречалось. Это работает и с опечатками: «компютер» разобьётся на «комп» и «ютер», что близко к правильному варианту.
Вывод: субслова — компромисс между скоростью, памятью и пониманием нового. Благодаря им нейросети не заучивают слова, а учатся мыслить частями, как люди, впервые слышащие незнакомое слово. Этот механизм лежит в основе большинства современных языковых моделей — от переводчиков до чат-ботов.
Поделиться