Токенизация BPE
Как это работает? Сначала каждый символ становится токеном: «а», «б», «в». Затем алгоритм подсчитывает, какие пары символов встречаются чаще, и заменяет их новым токеном. Из пары «ст» получается токен «ст», потом из «ст» и «о» — токен «сто». После многих шагов токены похожи на части слов: «стол», «пере-», «-ка». Если модель встречает незнакомое слово, она раскладывает его на знакомые токены и работает дальше.
Пример: англо-русский переводчик в браузере встречает слово "unbelievable". BPE выделяет токены "un", "believ", "able", и модель переводит его, а также родственное "belief". Этот принцип используют GPT, BERT и другие популярные системы.
Вывод: BPE — компромисс между размером словаря, скоростью и качеством понимания языка. Благодаря ей нейросети быстро осваивают сленг и редкие термины, оставаясь компактными для практического использования.
Поделиться