глоссарий

SentencePiece

SentencePiece

SentencePiece — это алгоритм разбиения текста на токены. В отличие от обычных токенизаторов, он работает напрямую с сырым текстом, превращая его в подслова или отдельные символы. Это позволяет моделям понимать незнакомые слова и экономить память.

Зачем это нужно? Языки устроены по-разному: в японском или китайском нет явных границ слов, а в любом языке встречаются имена, термины, сокращения и опечатки. SentencePiece обучает универсальный «конструктор»: он находит повторяющиеся морфемы, корни, суффиксы и целые слова, а затем собирает из них новые комбинации. Это называется субсловной токенизацией.

Представьте игру в кубики. Алгоритм анализирует большой корпус текстов, подсчитывает частые последовательности букв и выбирает базовые блоки. Новый текст разбивается на самые длинные известные части, а неизвестные — до уровня символов. Например, «киберпанк» делится на «кибер» и «панк», а незнакомое «киберпанкопедия» — на «кибер», «панк», «опед», «ия».

Пример: в машинном переводе редкое название лекарства, которого нет в словаре, SentencePiece разобьёт на «amox» и «icillin» и передаст модели как токены. Модель увидит знакомые фрагменты и переведёт осмысленно. Так же работает с неологизмами и интернет-сленгом.

Итог: SentencePiece — гибкий мост между текстом и нейросетью. Он позволяет моделям работать с любыми языками, не боясь редких слов, и экономит память. Машина воспринимает язык не как жёсткий список, а как живую систему из понятных кусочков.