Как собрать eval-сет для RAG и не обмануть себя цифрой
Отсюда возникает необходимость в собственном eval-наборе. Но вокруг его создания часто формируется ложная развилка: одни считают, что нужен огромный размеченный корпус с тысячами примеров, другие полагаются на готовые датасеты и не адаптируют их под свою специфику. На практике для первых экспериментов достаточно 100–300 кейсов, собранных вручную. Важно, чтобы они отражали реальные запросы пользователей, а не гипотетические сценарии. Запросы можно взять из логов поиска, обращений в поддержку или сформулировать вместе с профильными экспертами.
Размечая кейсы, нужно фиксировать не только бинарную релевантность «подошёл документ или нет», но и качество ранжирования: есть ли пропуски важных материалов, насколько далеко в выдаче ушёл нужный ответ, возникают ли ложные срабатывания. Полезно также заранее определить, какие ошибки критичны для вашего продукта: если система используется в медицинской или юридической сфере, цена пропуска релевантного документа выше, чем пара лишних нерелевантных в выдаче.
Наконец, важно не относиться к eval-сету как к статичному артефакту. Данные и запросы меняются, поэтому набор нужно периодически обновлять и дополнять. Собственноручно собранный даже небольшой набор кейсов даёт гораздо более честную картину, чем любой внешний бенчмарк, и позволяет принимать решения по оптимизации на основе реальных потребностей пользователей. Именно такой подход помогает увидеть, что метрики роста на общих датасетах не всегда означают улучшение качества на вашем домене.
Источник: habr.com
Поделиться