Arena hard
Это похоже на спортивный чемпионат: два шахматиста играют партию, зрители голосуют за убедительность. Модели получают открытые вопросы без единственного правильного ответа, победителя определяет сравнительное суждение. Чем больше «матчей», тем надёжнее рейтинг. Задачи специально подбирают сложные — это хардкор для коварных запросов, где слабые модели сразу видны.
Пример: разработчики чат-бота для юридической консультации хотят понять, какая модель лучше объясняет права потребителя. Они берут 100 каверзных вопросов от клиентов и прогоняют через две модели. Судьи ставят победу той, чей ответ яснее и точнее по существу, а не длиннее. В итоге выбирают модель с 65% побед в Arena hard, хотя в стандартных тестах она уступала. Такой подход фокусируется на реальной пользе для пользователей.
Вывод: Arena hard измеряет способность мыслить в диалоге. Он не заменяет классические тесты, но дополняет их человеческим взглядом. Для пользователя это значит, что модели становятся умнее в живом общении, а не на бумаге.
Поделиться