Архив рубрики ~Лента новостей~

Как включение двух настроек утроило наши результаты в бенчмарке ARC-AGI-3 | OpenAI

Как включение двух настроек утроило наши результаты в бенчмарке ARC-AGI-3 | OpenAI
Как включение двух настроек утроило наши результаты в бенчмарке ARC-AGI-3 | OpenAI

  • ARC-AGI-3
  • Агенты добиваются наилучших результатов, когда помнят, что они сделали.
  • Заключение и рекомендации
  • ARC-AGI-3
  • Агенты добиваются наилучших результатов, когда помнят, что они сделали.
  • Заключение и рекомендации

Ускоренное видео, демонстрирующее попытку GPT-5.6 Sol решить головоломки в бенчмарке ARC-AGI-3 с использованием официального модуля (слева) и нашего модуля Responses API (справа), который сохраняет логическую логику и обеспечивает компактизацию. В таблице лидеров этой игры (открывается в новом окне) ни одна модель-форвард не решает ни один уровень, кроме первого. С нашим модулем GPT-5.6 Sol решает все шесть уровней.

Когда мы впервые увидели низкие результаты GPT-5.6 Sol в бенчмарке ARC-AGI-3 (открывается в новом окне) , мы были озадачены.

GPT-5.6 Sol решил давние нерешенные математические проблемы, такие как гипотеза о двойном покрытии циклов (открывается в новом окне) , и прошел такие игры, как Pokémon FireRed. Но на ARC-AGI-3, бенчмарке для 2D-головоломок, GPT-5.6 Sol набрал всего 7,8%, а GPT-5.5 едва смог запустить эти игры, набрав жалкие 0,4%.

Были ли двухмерные головоломки необычайно сложными для наших моделей? Или дело было в чем-то другом?

Бенчмарки редко измеряют модели ИИ изолированно. Они также измеряют менее очевидные решения, касающиеся настроек API, проектирования среды выполнения и подсказок. В случае с ARC-AGI-3 мы обнаружили, что включение двух настроек API, которые мы используем в ChatGPT и Codex — сохранение рассуждений и компактизация — утроило оценки и сократило количество выходных токенов в 6 раз в общедоступном наборе задач.

ARC-AGI-3

ARC-AGI-3 — это бенчмарк, разработанный для оценки того, насколько хорошо агенты ИИ обучаются и рассуждают. Агенты исследуют незнакомые 2D-игры и делают выводы об их работе без явных инструкций. Вы можете сыграть в 25 демо-игр на сайте arcprize.org/tasks (откроется в новом окне) .

ARC-AGI-3 использует намеренно универсальный шаблон, без инструментов или специальных функций. Логика ARC заключалась в том, что простой шаблон делает недостатки модели более заметными и обеспечивает более объективное сравнение моделей. Коммерческие разработчики, напротив, оптимизируют шаблоны под особенности и характеристики каждой модели.

В играх GPT-5.6 Sol прошёл Pokémon FireRed, используя только визуальное управление (трансляция GPT_Plays_Pokemon (открывается в новом окне) ), Slay the Spire, используя компьютер Codex (трансляция EpochAI (открывается в новом окне) ) и первые этапы Baba Is You (показано Петром Мигдалом и Петром Грабовским (открывается в новом окне) ). Что же такого особенного было в ARC-AGI-3?

Итан Моллик показывает (открывается в новом окне) GPT-5.6 Sol в Codex, выполняющий случайное ежедневное задание в Slay the Spire 2, игре, выпущенной после достижения предельного уровня знаний GPT-5.6 Sol.

Вдохновленные анализом недостатков GPT-5.5, проведенным ARC (открывается в новом окне) , мы изучили некоторые попытки GPT-5.6 Sol. Как и ARC, мы увидели, что модель не отличалась особым умом. Она слишком долго задерживалась на каждом действии и с трудом продвигалась вперед.

Однако, при более детальном изучении, мы обнаружили, что большая часть путаницы, возникающей из-за этой модели, была вызвана не самой моделью, а настройками в жгуте проводов.

Во-первых, мы заметили, что после каждого игрового действия все внутренние рассуждения отбрасывались. Это означало, что с каждым действием GPT-5.6 Sol приходилось заново разбираться в игре, не вспоминая своих прошлых размышлений. Модель по-прежнему видела запись прошлых ходов и краткие сопроводительные заметки, но не могла видеть планы, идеи или мысли, которые к ним привели.

Во-вторых, мы увидели, что в системе использовалось окно с плавающим усечением, из-за чего более ранние действия становились невидимыми по мере накопления истории. Таким образом, GPT-5.6 Sol не только не мог вспомнить свои прошлые мысли, но и терял память о своих прошлых действиях.

Вместе эти две особенности программы — отбрасывание логических рассуждений и постепенное усечение — помогли объяснить, почему GPT-5.6 Sol испытывал трудности с обучением с течением времени.

Агенты добиваются наилучших результатов, когда помнят, что они сделали.

Наши модели обучены обрабатывать внутренние логические сообщения, прежде чем выдавать ответы или вызывать инструменты. Эти внутренние логические сообщения сохраняются как часть истории разговора. Если разговор затягивается, мы его кратко излагаем и продолжаем.

Диаграмма, демонстрирующая взаимодействие моделей логического мышления, вызовов инструментов, истории диалогов и сжатия контекста в рамках длительной задачи.

Так обучаются наши модели, а также так они развертываются в ChatGPT и Codex. Для лучшего соответствия нашей производственной среде мы внедрили ARC-AGI-3 с нашим API для обработки ответов (открывается в новом окне) . Наш API упрощает управление контекстом: для GPT-5.6 передача предыдущего идентификатора ответа автоматически сохраняет логику между вызовами инструментов и обращениями.

Сохранив способность к рассуждению, мы заметили два важных изменения. Во-первых, GPT-5.6 Sol тратил меньше времени на обдумывание каждого действия, поскольку ему больше не приходилось интерпретировать игру с нуля каждый ход. Во-вторых, когда он смог запоминать свои прошлые мысли, GPT-5.6 Sol значительно лучше обучался с течением времени и применял последовательные стратегии.

Следующее улучшение заключалось в замене скользящего усечения на уплотнение (открывается в новом окне) , еще одну настройку в API ответов.

Система ARC-AGI-3 решает проблему ограничений контекста с помощью скользящего усечения. Когда контекст разговора превышает 175 000 символов, самые старые сообщения отбрасываются.

Метод скользящего усечения имеет два недостатка. Во-первых, модель теряет более ранние наблюдения и действия. Во-вторых, она тратит большую часть задач на работу с более полным контекстным окном, что может незначительно ухудшить производительность.

Когда мы включили сжатие данных в ARC-AGI-3, GPT-5.6 Sol лучше сохранял полученные знания о каждой игре на протяжении более длительных запусков и достиг более высокого результата при меньшем количестве выходных токенов.

Чтобы проиллюстрировать эффект сохранения логики рассуждений и включения сжатия данных, приведем анимацию, демонстрирующую контекстное окно GPT-5.6 Sol размером 175 КБ при решении серии головоломок ARC-AGI-3 с использованием каждого из модулей.

Две центральные колонки показывают, как контекстное окно модели используется по-разному в каждой версии. Благодаря лучшей памяти о прошлом, GPT-5.6 Sol обрабатывает меньше действий и работает намного быстрее. Примечание: в нашей реализации используется ограничение в 175 000 токенов вместо символов, но в итоге результат оказывается довольно похожим, поскольку подавляющее большинство текста представляет собой сетки действий, которые токенизируются нашим токенизатором в соотношении 1:1.

Благодаря сочетанию логического мышления и компактизации, GPT-5.6 Sol (max) достигает примерно в 3 раза большего результата при в 6 раз меньшем количестве выходных токенов.

Заключение и рекомендации

Мы надеемся, что эти эксперименты послужат напоминанием о том, что при оценке моделей редко измеряется изолированно — они также измеряют целый ряд менее заметных факторов, касающихся настроек API, дизайна среды тестирования и подсказок. Это не первый случай, когда нас удивляют низкие результаты в общедоступном бенчмарке, а затем выясняется, что программа оценки использовала стандартную среду тестирования, которая пропускала сообщения с обоснованием.

Если вы разработчик API и стремитесь к максимальной производительности, мы рекомендуем использовать те же настройки, которые мы применяем в наших собственных продуктах:

  • Используйте наш API для обработки ответов, а не устаревший API для завершения чата.
  • Сохраняйте рассуждения.
  • Используйте уплотнение

А если вы сравниваете модели, мы рекомендуем полагаться на оценочные версии, использующие указанные выше настройки, которые наилучшим образом соответствуют реальному использованию в ChatGPT и Codex.

Мы благодарны ARC за многолетнюю творческую работу по оценке искусственного общего интеллекта, а также за анализ, который вдохновил нас на более детальное изучение этого вопроса.

Если вы хотите проверить свои силы в сравнении с передовыми моделями, попробуйте сами поучаствовать в публичных играх на сайте arcprize.org/tasks (откроется в новом окне) .

Источник: openai.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Пять лет работы определили внедрение Diligent Robotics Moxi 2.0 Новости робототехники Как Generalist использует демонстрационные данные с использованием людей для обучения роботов Архив рубрики ~Коротко из Telegram~ В работе сервисов Microsoft произошёл масштабный сбой Пользователи жалуются на… Новости робототехники Gravis Robotics вложила 200 миллионов долларов на автономное строительство Новости робототехники Человекоподобные машины не так хороши, как принято мечтать Архив рубрики ~Коротко из Telegram~ ✔️ Робособаки вытесняют охранников в США Американские компании начали активно использовать робособак… Архив рубрики ~Коротко из Telegram~ ✔️ River AI привлек $1.1 млрд Игорь Бабушкин, бывший сооснователь… Новости робототехники Uber добавляет дроны Zipline в свою сеть доставки еды Eats. Архив рубрики ~Коротко из Telegram~ Парень навайбкодил сайт, где продаёт рекламные места на… унитазе. И… Архив рубрики ~Коротко из Telegram~ Мой ИИ врач (и как сделать себе такого же) В… Архив рубрики ~Коротко из Telegram~ Чапалах по Antrophic: удаляйте любые ИИ-метки с вашего текста и… Архив рубрики ~Коротко из Telegram~ Маску не хватает всей мировой индустрии чипов. Tesla и SpaceX… Архив рубрики ~Коротко из Telegram~ Нашли библиотеку референсов для сильного веб-дизайна Для всех, кто делает… Архив рубрики ~Коротко из Telegram~ Xiaomi выпустила очиститель воды, который сразу наливает КИПЯТОК — чайник… Новости робототехники Пять лет работы определили внедрение Diligent Robotics Moxi 2.0 Новости робототехники Как Generalist использует демонстрационные данные с использованием людей для обучения роботов Архив рубрики ~Коротко из Telegram~ В работе сервисов Microsoft произошёл масштабный сбой Пользователи жалуются на… Новости робототехники Gravis Robotics вложила 200 миллионов долларов на автономное строительство Новости робототехники Человекоподобные машины не так хороши, как принято мечтать Архив рубрики ~Коротко из Telegram~ ✔️ Робособаки вытесняют охранников в США Американские компании начали активно использовать робособак… Архив рубрики ~Коротко из Telegram~ ✔️ River AI привлек $1.1 млрд Игорь Бабушкин, бывший сооснователь… Новости робототехники Uber добавляет дроны Zipline в свою сеть доставки еды Eats. Архив рубрики ~Коротко из Telegram~ Парень навайбкодил сайт, где продаёт рекламные места на… унитазе. И… Архив рубрики ~Коротко из Telegram~ Мой ИИ врач (и как сделать себе такого же) В… Архив рубрики ~Коротко из Telegram~ Чапалах по Antrophic: удаляйте любые ИИ-метки с вашего текста и… Архив рубрики ~Коротко из Telegram~ Маску не хватает всей мировой индустрии чипов. Tesla и SpaceX… Архив рубрики ~Коротко из Telegram~ Нашли библиотеку референсов для сильного веб-дизайна Для всех, кто делает… Архив рубрики ~Коротко из Telegram~ Xiaomi выпустила очиститель воды, который сразу наливает КИПЯТОК — чайник…

Оставить комментарий