ARC-AGI-2 train и eval оказались разными распределениями
новости
18.08.2026

ARC-AGI-2 train и eval оказались разными распределениями

ARC-AGI-2 train и eval оказались разными распределениями

Автор анализа, посвященного ARC-AGI-2, обращает внимание на системное расхождение между обучающим и тестовым наборами бенчмарка. Если оценивать прогресс солвера на случайной подвыборке из train, результат будет нерепрезентативным: train и eval — это разные распределения задач. Различие прослеживается по всем шести структурным осям, которые удалось измерить, и сохраняется после поправки на множественные сравнения.

Цифры выглядят показательно. Медианная задача из train занимает на выходе 100 клеток, у медианной задачи из eval этот показатель составляет 225. Два и более тестовых входа требуются для 6,9 процента задач train и для 40,8 процента задач eval. Такой разрыв вряд ли можно списать на случайность.

В материале приведено распределительное сравнение обоих публичных наборов ARC-AGI-2, отпечатки файлов, на которых оно основано, а также подмножество train, подобранное под eval по структуре. Полный список задач выложен в виде CSV-файла.

Важная оговорка: речь идет о структуре задач, а не о сложности для человека. Свой индекс автор проверил на человеческих решениях, и проверку он не прошел. Значит, по этим данным нельзя утверждать, что eval-задачи легче или тяжелее для людей, — но можно сказать, что они устроены иначе.

Практическое следствие: разработчики, которые используют train как прокси для оценки качества, рискуют получить смещенные результаты. Наибольшее беспокойство вызывает доля задач с несколькими тестовыми входами: почти 41 процент eval против семи процентов в train. Солвер, отлаженный на одиночных входах, на экзамене столкнется с систематически другим материалом.

Источник: habr.com