Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимог
новости
18.08.2026

Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6

Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6

Шесть языковых моделей, созданных в четырёх разных лабораториях и трёх странах, участвовали в оценке ответов систем искусственного интеллекта на открытом бенчмарке RAGTruth. Ожидалось, что столь разнородный коллектив судей будет принимать более надёжные решения, чем один эксперт. Однако исследователи обнаружили, что ошибки этих моделей сильно коррелируют друг с другом: средняя попарная корреляция составила примерно 0,42. С учётом этого эффективный размер комитета, рассчитанный по design-effect приближению, равен всего лишь 1,9 независимого голоса из шести возможных.

Это означает, что шесть моделей несут примерно столько же независимой информации, сколько чуть меньше двух полностью независимых судей. Интуиция подсказывала, что разные архитектуры, компании и страны происхождения должны обеспечивать независимость ошибок, но реальность оказалась иной. Разнообразие провайдеров не покупает независимость вердиктов: корреляция между ошибками моделей достаточно высока, чтобы выродить преимущества коллективного голосования.

Теорема Кондорсе, описывающая преимущество коллективных решений, для коррелированных голосов не отменяется — как показали работы Ладхи и Боланда, — но её гарантии становятся значительно слабее. Шесть коррелированных голосов работают как примерно два эффективных, и показатель 1,9 лишь оценивает масштаб вырождения. Для практики применения LLM-судей это означает, что простое увеличение числа моделей в комитете не гарантирует роста надёжности оценок: необходимо учитывать корреляцию ошибок и, возможно, искать способы диверсификации, например за счёт разных обучающих данных или методов самооценки.

Авторы исследования опубликовали в открытом репозитории методологию, данные и скрипт, который позволяет пересчитать среднюю попарную корреляцию ошибок и эффективное число независимых судей непосредственно из сохранённых вердиктов, без единого обращения к API. Это делает результаты полностью воспроизводимыми и позволяет другим командам применить ту же методику к своим наборам данных.

Источник: habr.com