Train и eval в ARC-AGI-2 — это разные распределения
Если вы замеряете прогресс своего солвера на случайной подвыборке из train, вы замеряете его не на том наборе. Медианная задача train занимает 100 клеток на выходе, у медианной задачи eval их 225. Два и более тестовых входа требуют 6.9 процента задач train и 40.8 процента задач eval. Расхождение держится по всем шести структурным осям, которые я померил, и переживает поправку на множественные сравнения.
Дальше идёт распределительное сравнение обоих публичных наборов ARC-AGI-2, отпечатки файлов, на которых оно сделано, и подмножество из train, подобранное под eval по структуре. CSV со списком задач в конце.
Сразу оговорка, к которой я вернусь отдельным разделом: всё это про структуру, а не про сложность для человека. Свой же индекс я проверил против человеческих решений, и он проверку не прошёл.
Что показали измерения
Источник: habr.com
Оцените материал:
Похожие записи
Google приостановил свою программу вознаграждения за обнаружение уязвимостей в открытом исходном коде из-за «значительного роста» числа сообщений об ошибках в сфере искусственного интеллекта.
05.10.2026
Meta* представила проект с открытым исходным кодом Muse Gadgets — пользователи могут запустить её ИИ-агента на «самодельных» устройствах
05.10.2026
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
