Архив рубрики ~Лента новостей~

Как включение двух настроек утроило наши результаты в бенчмарке ARC-AGI-3 | OpenAI

Как включение двух настроек утроило наши результаты в бенчмарке ARC-AGI-3 | OpenAI
Как включение двух настроек утроило наши результаты в бенчмарке ARC-AGI-3 | OpenAI

  • ARC-AGI-3
  • Агенты добиваются наилучших результатов, когда помнят, что они сделали.
  • Заключение и рекомендации
  • ARC-AGI-3
  • Агенты добиваются наилучших результатов, когда помнят, что они сделали.
  • Заключение и рекомендации

Ускоренное видео, демонстрирующее попытку GPT-5.6 Sol решить головоломки в бенчмарке ARC-AGI-3 с использованием официального модуля (слева) и нашего модуля Responses API (справа), который сохраняет логическую логику и обеспечивает компактизацию. В таблице лидеров этой игры (открывается в новом окне) ни одна модель-форвард не решает ни один уровень, кроме первого. С нашим модулем GPT-5.6 Sol решает все шесть уровней.

Когда мы впервые увидели низкие результаты GPT-5.6 Sol в бенчмарке ARC-AGI-3 (открывается в новом окне) , мы были озадачены.

GPT-5.6 Sol решил давние нерешенные математические проблемы, такие как гипотеза о двойном покрытии циклов (открывается в новом окне) , и прошел такие игры, как Pokémon FireRed. Но на ARC-AGI-3, бенчмарке для 2D-головоломок, GPT-5.6 Sol набрал всего 7,8%, а GPT-5.5 едва смог запустить эти игры, набрав жалкие 0,4%.

Были ли двухмерные головоломки необычайно сложными для наших моделей? Или дело было в чем-то другом?

Бенчмарки редко измеряют модели ИИ изолированно. Они также измеряют менее очевидные решения, касающиеся настроек API, проектирования среды выполнения и подсказок. В случае с ARC-AGI-3 мы обнаружили, что включение двух настроек API, которые мы используем в ChatGPT и Codex — сохранение рассуждений и компактизация — утроило оценки и сократило количество выходных токенов в 6 раз в общедоступном наборе задач.

ARC-AGI-3

ARC-AGI-3 — это бенчмарк, разработанный для оценки того, насколько хорошо агенты ИИ обучаются и рассуждают. Агенты исследуют незнакомые 2D-игры и делают выводы об их работе без явных инструкций. Вы можете сыграть в 25 демо-игр на сайте arcprize.org/tasks (откроется в новом окне) .

ARC-AGI-3 использует намеренно универсальный шаблон, без инструментов или специальных функций. Логика ARC заключалась в том, что простой шаблон делает недостатки модели более заметными и обеспечивает более объективное сравнение моделей. Коммерческие разработчики, напротив, оптимизируют шаблоны под особенности и характеристики каждой модели.

В играх GPT-5.6 Sol прошёл Pokémon FireRed, используя только визуальное управление (трансляция GPT_Plays_Pokemon (открывается в новом окне) ), Slay the Spire, используя компьютер Codex (трансляция EpochAI (открывается в новом окне) ) и первые этапы Baba Is You (показано Петром Мигдалом и Петром Грабовским (открывается в новом окне) ). Что же такого особенного было в ARC-AGI-3?

Итан Моллик показывает (открывается в новом окне) GPT-5.6 Sol в Codex, выполняющий случайное ежедневное задание в Slay the Spire 2, игре, выпущенной после достижения предельного уровня знаний GPT-5.6 Sol.

Вдохновленные анализом недостатков GPT-5.5, проведенным ARC (открывается в новом окне) , мы изучили некоторые попытки GPT-5.6 Sol. Как и ARC, мы увидели, что модель не отличалась особым умом. Она слишком долго задерживалась на каждом действии и с трудом продвигалась вперед.

Однако, при более детальном изучении, мы обнаружили, что большая часть путаницы, возникающей из-за этой модели, была вызвана не самой моделью, а настройками в жгуте проводов.

Во-первых, мы заметили, что после каждого игрового действия все внутренние рассуждения отбрасывались. Это означало, что с каждым действием GPT-5.6 Sol приходилось заново разбираться в игре, не вспоминая своих прошлых размышлений. Модель по-прежнему видела запись прошлых ходов и краткие сопроводительные заметки, но не могла видеть планы, идеи или мысли, которые к ним привели.

Во-вторых, мы увидели, что в системе использовалось окно с плавающим усечением, из-за чего более ранние действия становились невидимыми по мере накопления истории. Таким образом, GPT-5.6 Sol не только не мог вспомнить свои прошлые мысли, но и терял память о своих прошлых действиях.

Вместе эти две особенности программы — отбрасывание логических рассуждений и постепенное усечение — помогли объяснить, почему GPT-5.6 Sol испытывал трудности с обучением с течением времени.

Агенты добиваются наилучших результатов, когда помнят, что они сделали.

Наши модели обучены обрабатывать внутренние логические сообщения, прежде чем выдавать ответы или вызывать инструменты. Эти внутренние логические сообщения сохраняются как часть истории разговора. Если разговор затягивается, мы его кратко излагаем и продолжаем.

Диаграмма, демонстрирующая взаимодействие моделей логического мышления, вызовов инструментов, истории диалогов и сжатия контекста в рамках длительной задачи.

Так обучаются наши модели, а также так они развертываются в ChatGPT и Codex. Для лучшего соответствия нашей производственной среде мы внедрили ARC-AGI-3 с нашим API для обработки ответов (открывается в новом окне) . Наш API упрощает управление контекстом: для GPT-5.6 передача предыдущего идентификатора ответа автоматически сохраняет логику между вызовами инструментов и обращениями.

Сохранив способность к рассуждению, мы заметили два важных изменения. Во-первых, GPT-5.6 Sol тратил меньше времени на обдумывание каждого действия, поскольку ему больше не приходилось интерпретировать игру с нуля каждый ход. Во-вторых, когда он смог запоминать свои прошлые мысли, GPT-5.6 Sol значительно лучше обучался с течением времени и применял последовательные стратегии.

Следующее улучшение заключалось в замене скользящего усечения на уплотнение (открывается в новом окне) , еще одну настройку в API ответов.

Система ARC-AGI-3 решает проблему ограничений контекста с помощью скользящего усечения. Когда контекст разговора превышает 175 000 символов, самые старые сообщения отбрасываются.

Метод скользящего усечения имеет два недостатка. Во-первых, модель теряет более ранние наблюдения и действия. Во-вторых, она тратит большую часть задач на работу с более полным контекстным окном, что может незначительно ухудшить производительность.

Когда мы включили сжатие данных в ARC-AGI-3, GPT-5.6 Sol лучше сохранял полученные знания о каждой игре на протяжении более длительных запусков и достиг более высокого результата при меньшем количестве выходных токенов.

Чтобы проиллюстрировать эффект сохранения логики рассуждений и включения сжатия данных, приведем анимацию, демонстрирующую контекстное окно GPT-5.6 Sol размером 175 КБ при решении серии головоломок ARC-AGI-3 с использованием каждого из модулей.

Две центральные колонки показывают, как контекстное окно модели используется по-разному в каждой версии. Благодаря лучшей памяти о прошлом, GPT-5.6 Sol обрабатывает меньше действий и работает намного быстрее. Примечание: в нашей реализации используется ограничение в 175 000 токенов вместо символов, но в итоге результат оказывается довольно похожим, поскольку подавляющее большинство текста представляет собой сетки действий, которые токенизируются нашим токенизатором в соотношении 1:1.

Благодаря сочетанию логического мышления и компактизации, GPT-5.6 Sol (max) достигает примерно в 3 раза большего результата при в 6 раз меньшем количестве выходных токенов.

Заключение и рекомендации

Мы надеемся, что эти эксперименты послужат напоминанием о том, что при оценке моделей редко измеряется изолированно — они также измеряют целый ряд менее заметных факторов, касающихся настроек API, дизайна среды тестирования и подсказок. Это не первый случай, когда нас удивляют низкие результаты в общедоступном бенчмарке, а затем выясняется, что программа оценки использовала стандартную среду тестирования, которая пропускала сообщения с обоснованием.

Если вы разработчик API и стремитесь к максимальной производительности, мы рекомендуем использовать те же настройки, которые мы применяем в наших собственных продуктах:

  • Используйте наш API для обработки ответов, а не устаревший API для завершения чата.
  • Сохраняйте рассуждения.
  • Используйте уплотнение

А если вы сравниваете модели, мы рекомендуем полагаться на оценочные версии, использующие указанные выше настройки, которые наилучшим образом соответствуют реальному использованию в ChatGPT и Codex.

Мы благодарны ARC за многолетнюю творческую работу по оценке искусственного общего интеллекта, а также за анализ, который вдохновил нас на более детальное изучение этого вопроса.

Если вы хотите проверить свои силы в сравнении с передовыми моделями, попробуйте сами поучаствовать в публичных играх на сайте arcprize.org/tasks (откроется в новом окне) .

Источник: openai.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ Американский стартап Veterans Recovery Network Inc. анонсировал концепт проекта «цифрового… Архив рубрики ~Коротко из Telegram~ Энергетики «нанимают» овец, а технологии спасают экосистему На пустынном плато… Архив рубрики ~Коротко из Telegram~ Подборку топовых курсов по ИИ от Microsoft нашли в сети… Архив рубрики ~Коротко из Telegram~ 🎮 Roblox запускает Build Roblox анонсировал Build — новый AI-инструмент, встроенный прямо в… Архив рубрики ~Коротко из Telegram~ Microsoft представила два новых ИИ-движка: MAI Image 2.5 Pro и… Архив рубрики ~Коротко из Telegram~ 📊 Как тестируют ИИ-модели — и почему рейтингам верить с… Архив рубрики ~Коротко из Telegram~ Runway упростил жизнь контент-мейкерам: Media Router выбирает модель за вас… Архив рубрики ~Коротко из Telegram~ Suno подвинули от колонки — Google пару часов назад выкатили модель… Архив рубрики ~Коротко из Telegram~ Xiaomi представила свой «Range Rover» — внедорожник Skynomad N90 Max… Архив рубрики ~Коротко из Telegram~ ☀️ 1Password запустила интеграцию с Claude — теперь агент может… Новости робототехники Бои без правил будущего: робот потерял голову на турнире по ММА, но продолжил бой! ?? Архив рубрики ~Коротко из Telegram~ Дуров переодел аватарку в вахаббита  — основатель Telegram подхватил волну… Архив рубрики ~Коротко из Telegram~ Авито Подработка помогает бизнесу стабильнее закрывать смены  — платформа запустила инструмент… Архив рубрики ~Коротко из Telegram~ Финляндия обрежет часть интернет-кабелей между Россией и Европой. С 2027… Архив рубрики ~Коротко из Telegram~ Американский стартап Veterans Recovery Network Inc. анонсировал концепт проекта «цифрового… Архив рубрики ~Коротко из Telegram~ Энергетики «нанимают» овец, а технологии спасают экосистему На пустынном плато… Архив рубрики ~Коротко из Telegram~ Подборку топовых курсов по ИИ от Microsoft нашли в сети… Архив рубрики ~Коротко из Telegram~ 🎮 Roblox запускает Build Roblox анонсировал Build — новый AI-инструмент, встроенный прямо в… Архив рубрики ~Коротко из Telegram~ Microsoft представила два новых ИИ-движка: MAI Image 2.5 Pro и… Архив рубрики ~Коротко из Telegram~ 📊 Как тестируют ИИ-модели — и почему рейтингам верить с… Архив рубрики ~Коротко из Telegram~ Runway упростил жизнь контент-мейкерам: Media Router выбирает модель за вас… Архив рубрики ~Коротко из Telegram~ Suno подвинули от колонки — Google пару часов назад выкатили модель… Архив рубрики ~Коротко из Telegram~ Xiaomi представила свой «Range Rover» — внедорожник Skynomad N90 Max… Архив рубрики ~Коротко из Telegram~ ☀️ 1Password запустила интеграцию с Claude — теперь агент может… Новости робототехники Бои без правил будущего: робот потерял голову на турнире по ММА, но продолжил бой! ?? Архив рубрики ~Коротко из Telegram~ Дуров переодел аватарку в вахаббита  — основатель Telegram подхватил волну… Архив рубрики ~Коротко из Telegram~ Авито Подработка помогает бизнесу стабильнее закрывать смены  — платформа запустила инструмент… Архив рубрики ~Коротко из Telegram~ Финляндия обрежет часть интернет-кабелей между Россией и Европой. С 2027…

Оставить комментарий