ARC-AGI-2 train и eval оказались разными распределениями
Цифры выглядят показательно. Медианная задача из train занимает на выходе 100 клеток, у медианной задачи из eval этот показатель составляет 225. Два и более тестовых входа требуются для 6,9 процента задач train и для 40,8 процента задач eval. Такой разрыв вряд ли можно списать на случайность.
В материале приведено распределительное сравнение обоих публичных наборов ARC-AGI-2, отпечатки файлов, на которых оно основано, а также подмножество train, подобранное под eval по структуре. Полный список задач выложен в виде CSV-файла.
Важная оговорка: речь идет о структуре задач, а не о сложности для человека. Свой индекс автор проверил на человеческих решениях, и проверку он не прошел. Значит, по этим данным нельзя утверждать, что eval-задачи легче или тяжелее для людей, — но можно сказать, что они устроены иначе.
Практическое следствие: разработчики, которые используют train как прокси для оценки качества, рискуют получить смещенные результаты. Наибольшее беспокойство вызывает доля задач с несколькими тестовыми входами: почти 41 процент eval против семи процентов в train. Солвер, отлаженный на одиночных входах, на экзамене столкнется с систематически другим материалом.
Источник: habr.com
Поделиться