глоссарий

BLEU

BLEU

BLEU — метрика для автоматической оценки качества машинного перевода. Она сравнивает результат алгоритма с эталонными переводами, сделанными людьми. Чем ближе совпадение слов и их порядок, тем выше оценка.

Зачем это нужно? Проверять каждую новую модель вручную дорого и долго. BLEU даёт численную оценку за секунды и позволяет сравнивать версии алгоритмов. Это стандарт индустрии: без неё не обходится ни одно исследование в машинном переводе.

Как работает интуитивно: вы сверяете ученика с решебником — смотрите, сколько нужных слов и в правильном ли порядке. BLEU делает то же самое, но учитывает не только слова, но и пары, тройки и т.д. Например, при эталоне «кот сидит на окне» вариант «сидит кот на окне» получит штраф за порядок, а слишком короткий или с лишними словами — дополнительный штраф.

Пример: разработчики переводчика для туристического приложения взяли 1000 фраз, перевели вручную и подали как эталон. Новая модель дала 0,62, старая — 0,55. Значит, обновление лучше. Но нюанс: если текст нужен для юридических документов, только на BLEU полагаться нельзя — она не понимает смысла. Высокий балл возможен при формально верном, но бессмысленном переводе.

Вывод: BLEU — быстрый и дешёвый инструмент для объективного сравнения моделей, но приблизительный. Её слабость — отсутствие понимания языка. Поэтому в серьёзных проектах её используют вместе с ручной оценкой и другими метриками. Как первый фильтр для отбраковки слабых версий она незаменима.