MAUVE
Зачем она нужна? Модели часто выдают грамматически верные, но шаблонные или пустые фразы. Ранние метрики вроде BLEU или perplexity плохо улавливали это: они либо сравнивали с жёстким эталоном, либо мерили «удивление» модели, что не совпадает с восприятием человека. MAUVE же учитывает одновременно качество и разнообразие, поэтому ближе к реальным оценкам. Он помогает быстро заметить, не «выродилась» ли модель в повторяющего одни и те же обороты болтуна.
Как это работает интуитивно? Берём тысячу человеческих текстов и тысячу сгенерированных. Каждый превращаем в точку, где близкие по смыслу тексты лежат рядом. Получаем два облака точек. MAUVE измеряет степень их пересечения. Почти полное совпадение — модель пишет естественно. Маленькое облако ИИ в стороне от человеческого — застряла в узком наборе фраз или сильно отклонилась. При этом не требуется идеальное совпадение: допустимо частичное перекрытие, лишь бы модель не выдавала чуждого и не сужала словарь.
Пример. Разработчики обучают чат-бота поддержки на диалогах с клиентами. Чтобы проверить естественность ответов, они берут эталон — живые ответы операторов, и генерируют ответы бота на те же запросы. Результат MAUVE 0,85 — отлично, бот говорит почти как человек. 0,4 — пишет коряво или однообразно, нужно менять обучение. Так без ручного анализа тысяч сообщений видно, в какую сторону двигаться.
Итог: MAUVE — удобная «линейка» для измерения естественности машинного текста. Она не идеальна и требует ресурсов, но остаётся одним из самых надёжных способов оценить модель человеческим взглядом, а не только математическими формулами. Главное, она отвечает на простой вопрос: «Стало ли лучше?»
Поделиться