глоссарий

Токенизация BPE

Токенизация BPE

Токенизация BPE, или Byte Pair Encoding, — это способ разбиения текста на минимальные части для нейросети. Вместо хранения каждого слова целиком алгоритм объединяет часто встречающиеся пары символов в токены — единицы работы модели. Зачем это нужно? Современные языковые модели учатся на огромных корпусах текста. Если бы каждое слово было отдельным токеном, словарь разросся бы до миллионов позиций, что требует памяти и замедляет вычисления. BPE сокращает словарь до десятков тысяч токенов, но позволяет понимать редкие и новые слова.

Как это работает? Сначала каждый символ становится токеном: «а», «б», «в». Затем алгоритм подсчитывает, какие пары символов встречаются чаще, и заменяет их новым токеном. Из пары «ст» получается токен «ст», потом из «ст» и «о» — токен «сто». После многих шагов токены похожи на части слов: «стол», «пере-», «-ка». Если модель встречает незнакомое слово, она раскладывает его на знакомые токены и работает дальше.

Пример: англо-русский переводчик в браузере встречает слово "unbelievable". BPE выделяет токены "un", "believ", "able", и модель переводит его, а также родственное "belief". Этот принцип используют GPT, BERT и другие популярные системы.

Вывод: BPE — компромисс между размером словаря, скоростью и качеством понимания языка. Благодаря ей нейросети быстро осваивают сленг и редкие термины, оставаясь компактными для практического использования.