глоссарий

Human evaluation

Human evaluation

Human evaluation — оценка работы ИИ живыми людьми, а не автоматическими метриками. Эксперты или пользователи смотрят на результаты модели и судят: хорошо, плохо или приемлемо. Это незаменимо там, где качество нельзя измерить цифрами, например при оценке уместности ответа, естественности текста, полезности рекомендации или тона диалога.

Автоматика часто обманывает: модель может формально выполнить задачу, но выдать бессмыслицу или грубость. Машина сверяет слова с эталоном, не понимая контекста и эмоций. Человек видит иронию, намёки, логические ошибки, этические проблемы. Поэтому Human evaluation остаётся золотым стандартом для больших языковых моделей, переводчиков, ассистентов и рекомендательных систем. Без неё нет доверия к ИИ в таких чувствительных областях, как медицина или юриспруденция.

Интуитивно это похоже на дегустацию. Повар измеряет температуру и соль — автоматика, но вкусно ли, решает человек за столом. Так и с ИИ: собирают группу оценщиков, дают им одинаковые вводные, те сравнивают ответы моделей или оценивают по шкале. Оценщиков должно быть несколько — один субъективен, усреднённое мнение надёжнее. Критерии вроде «точность фактов» или «вежливость» заранее прописывают, чтобы снизить разброс.

Пример: медицинский чат-бот. Автотест скажет, что он отвечает быстро и по теме. Human evaluation выявит: на вопрос «У меня болит грудь» бот советует народные средства — это опасно. Врачи и пользователи проверяют безопасность и эмпатию, модель дорабатывают. Без такой проверки выпуск рискован.

Вывод: Human evaluation — мост между формальной корректностью алгоритма и реальным опытом. Она медленнее и дороже автоматики, но именно она отличает полезный ИИ от просто рабочего. Пока машины не чувствуют, как люди, финальным судьёй остаётся человек.