Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6
Это означает, что шесть моделей несут примерно столько же независимой информации, сколько чуть меньше двух полностью независимых судей. Интуиция подсказывала, что разные архитектуры, компании и страны происхождения должны обеспечивать независимость ошибок, но реальность оказалась иной. Разнообразие провайдеров не покупает независимость вердиктов: корреляция между ошибками моделей достаточно высока, чтобы выродить преимущества коллективного голосования.
Теорема Кондорсе, описывающая преимущество коллективных решений, для коррелированных голосов не отменяется — как показали работы Ладхи и Боланда, — но её гарантии становятся значительно слабее. Шесть коррелированных голосов работают как примерно два эффективных, и показатель 1,9 лишь оценивает масштаб вырождения. Для практики применения LLM-судей это означает, что простое увеличение числа моделей в комитете не гарантирует роста надёжности оценок: необходимо учитывать корреляцию ошибок и, возможно, искать способы диверсификации, например за счёт разных обучающих данных или методов самооценки.
Авторы исследования опубликовали в открытом репозитории методологию, данные и скрипт, который позволяет пересчитать среднюю попарную корреляцию ошибок и эффективное число независимых судей непосредственно из сохранённых вердиктов, без единого обращения к API. Это делает результаты полностью воспроизводимыми и позволяет другим командам применить ту же методику к своим наборам данных.
Источник: habr.com
Поделиться