SentencePiece
Зачем это нужно? Языки устроены по-разному: в японском или китайском нет явных границ слов, а в любом языке встречаются имена, термины, сокращения и опечатки. SentencePiece обучает универсальный «конструктор»: он находит повторяющиеся морфемы, корни, суффиксы и целые слова, а затем собирает из них новые комбинации. Это называется субсловной токенизацией.
Представьте игру в кубики. Алгоритм анализирует большой корпус текстов, подсчитывает частые последовательности букв и выбирает базовые блоки. Новый текст разбивается на самые длинные известные части, а неизвестные — до уровня символов. Например, «киберпанк» делится на «кибер» и «панк», а незнакомое «киберпанкопедия» — на «кибер», «панк», «опед», «ия».
Пример: в машинном переводе редкое название лекарства, которого нет в словаре, SentencePiece разобьёт на «amox» и «icillin» и передаст модели как токены. Модель увидит знакомые фрагменты и переведёт осмысленно. Так же работает с неологизмами и интернет-сленгом.
Итог: SentencePiece — гибкий мост между текстом и нейросетью. Он позволяет моделям работать с любыми языками, не боясь редких слов, и экономит память. Машина воспринимает язык не как жёсткий список, а как живую систему из понятных кусочков.
Поделиться