Как собрать eval-сет для RAG и не обмануть себя цифрой
новости
14.08.2026

Как собрать eval-сет для RAG и не обмануть себя цифрой

Как собрать eval-сет для RAG и не обмануть себя цифрой

При оценке систем поиска и генерации легко попасть в ловушку: после сжатия эмбеддингов модель может показывать почти полное совпадение выдачи с исходным fp32-поиском, но при этом плохо находить действительно нужные документы. Такое слепое пятно возникает потому, что замеряется лишь устойчивость ранжирования к квантизации, а не фактическая релевантность на вашем домене. Внешние бенчмарки этой проблемы не решают. Так, BEIR создавался, чтобы продемонстрировать, насколько результаты retrieval меняются между разными задачами и доменами, поэтому усреднённый скор по нему не гарантирует успеха на собственных данных.

Отсюда возникает необходимость в собственном eval-наборе. Но вокруг его создания часто формируется ложная развилка: одни считают, что нужен огромный размеченный корпус с тысячами примеров, другие полагаются на готовые датасеты и не адаптируют их под свою специфику. На практике для первых экспериментов достаточно 100–300 кейсов, собранных вручную. Важно, чтобы они отражали реальные запросы пользователей, а не гипотетические сценарии. Запросы можно взять из логов поиска, обращений в поддержку или сформулировать вместе с профильными экспертами.

Размечая кейсы, нужно фиксировать не только бинарную релевантность «подошёл документ или нет», но и качество ранжирования: есть ли пропуски важных материалов, насколько далеко в выдаче ушёл нужный ответ, возникают ли ложные срабатывания. Полезно также заранее определить, какие ошибки критичны для вашего продукта: если система используется в медицинской или юридической сфере, цена пропуска релевантного документа выше, чем пара лишних нерелевантных в выдаче.

Наконец, важно не относиться к eval-сету как к статичному артефакту. Данные и запросы меняются, поэтому набор нужно периодически обновлять и дополнять. Собственноручно собранный даже небольшой набор кейсов даёт гораздо более честную картину, чем любой внешний бенчмарк, и позволяет принимать решения по оптимизации на основе реальных потребностей пользователей. Именно такой подход помогает увидеть, что метрики роста на общих датасетах не всегда означают улучшение качества на вашем домене.

Источник: habr.com