Архив рубрики ~Лента новостей~

Исследователи Meta обучили модель ИИ с 8 миллиардами итераций достичь уровня Claude Opus 4.5 — без непомерных затрат, связанных с освоением новых технологий.

Исследователи Meta обучили модель ИИ с 8 миллиардами итераций достичь уровня Claude Opus 4.5 — без непомерных затрат, связанных с освоением новых технологий.
Исследователи Meta обучили модель ИИ с 8 миллиардами итераций достичь уровня Claude Opus 4.5 — без непомерных затрат, связанных с освоением новых технологий.

Бен Диксон

Рассмотрим ИИ-агента, которому поручено выполнить сложный корпоративный рабочий процесс, например, миграцию огромных объемов клиентских записей из устаревшей CRM-системы в облачную базу данных. Агент не может полагаться исключительно на свое внутреннее контекстное окно для задачи, занимающей несколько часов, и зависит от уровня выполнения, то есть от среды разработки.

Этот инструмент предоставляет обратную связь о ходе выполнения, например, журналы сервера, чтобы помочь агенту поддерживать точное понимание динамических API-подключений. Он также предоставляет средства отслеживания состояний и механизмы управления потоком выполнения для управления завершенными и ожидающими подцелями, гарантируя, что агент не пропустит и не дублирует пакеты данных. В случае возникновения непредвиденных ошибок, например, когда база данных отклоняет пакет из-за строгих ограничений скорости API, инструмент предоставляет средства и инструкции, которые помогут агенту восстановиться.

Основной способ указать агенту, как и когда использовать свои инструменты, — это поручить разработчику составить набор правил и инструкций, пошагово описывающих действия. Например, разработчик может дать агенту указание всегда искать информацию в корпоративной вики перед написанием электронного письма. Поскольку агент просто следует жесткому сценарию, ему не хватает истинной автономии. Он не обучен самостоятельно оценивать затраты и выгоды своих действий.

Для решения этой проблемы исследователи из Meta AI и Университета Иллинойса в Урбане-Шампейне представили EvoHarness-RL — фреймворк, который добавляет уровень абстракции к инструментарию агента и обучает базовую модель тому, когда следует считывать, обновлять или консолидировать информацию, полученную из окружающей среды.

В задачах с длительным горизонтом планирования решающее значение для успеха агентов ИИ имеет то, как они считывают и обрабатывают информацию, получаемую из окружающей среды. Агент должен обновлять свое понимание окружающей среды, отслеживать выполненные и ожидающие выполнения подцели, восстанавливаться после неудачных действий и повторно использовать процедуры из предыдущего опыта. Выполнение этих задач зависит от используемого программного обеспечения.

Ряд саморазвивающихся агентных фреймворков, таких как Harness-1, частично решает эту проблему, накапливая прошлые траектории и преобразуя их в структурированную процедурную память, например, в многократно используемые навыки, рабочие процессы или библиотеки кода для будущих задач. Однако они, как правило, отделяют это долгосрочное формирование навыков от отслеживания состояния в реальном времени внутри эпизода. Они не обучают агента активному управлению окружающей средой или отслеживанию активных этапов выполнения задач во время работы.

Сюйин Нин, соавтор статьи об EvoHarness-RL, рассказала VentureBeat, что ручная логика и жесткие структуры памяти являются основными причинами истощения инженерных ресурсов.

«Оптимальная конфигурация часто меняется в зависимости от модели», — объяснил Нин. «Разные модели могут требовать разных запросов, настроек памяти, разрешений или конфигураций песочницы. Если всю эту логику кодировать вручную, каждое обновление модели может привести к очередному длительному циклу настройки и отладки».

Кроме того, существующие системы памяти, которые просто накапливают опыт, могут активно ухудшать способность агента к рассуждению. «Память, основанная только на добавлении информации, предполагает, что дополнительный контекст всегда полезен, что не всегда верно», — сказал Нин. «В ходе выполнения длительной задачи память может содержать устаревшие выводы, неудачные попытки или информацию, которая больше не актуальна». В результате агентам, работающим в долгосрочной перспективе, необходима динамическая память, способная обновлять, сжимать и заменять информацию, чтобы избежать повторения прошлых ошибок.

EvoHarness-RL: Единое рабочее пространство для убеждений, прогресса и опыта.

Чтобы преодолеть ограничения жестких, ручных подсказок, исследователи представили EvoHarness-RL — метод обучения, который учит агента оптимально использовать свой набор инструментов. Вместо того чтобы слепо следовать жестко закодированным инструкциям, агент учится создавать структурированное рабочее пространство из неструктурированных данных выполнения и решать, когда и как обращаться к этому внешнему состоянию во время сложных рабочих процессов.

Для упрощения управления различными компонентами системы EvoHarness-RL объединяет системы поддержки оператора в единый унифицированный интерфейс. Этот интерфейс, известный как «Убеждения, Прогресс и Опыт» (BPE), классифицирует внешние потребности оператора по трем функциональным областям:

  • Убеждение: Поддерживать точную оценку текущей ситуации.

  • Прогресс: Управление выполненными и ожидающими выполнения подцелями.

  • Опыт: Повторное использование исторических знаний в различных задачах.

Вместо использования сложных, специфичных для конкретной предметной области API, ИИ взаимодействует с этой удобной панелью управления с помощью четырех компактных мета-действий: отслеживание, подтверждение, отзыв и заметка. Он отдает команды для отслеживания текущей среды, подтверждения обновлений рабочего процесса, отзыва прошлых стратегий перед выполнением действий и написания заметок для сохранения вновь обнаруженных данных для будущих запусков.

фреймворк BPE

Структура BPE (источник: arXiv)

Эти состояния напрямую соответствуют высокоценным отраслевым сегментам предприятия. «В разработке программного обеспечения «Убеждение» может отражать текущее понимание агентом репозитория», — сказал Нин, подробно описывая, как агент отслеживает взаимодействие компонентов и изменения в рабочем пространстве. «Прогресс отслеживает то, что уже выполнено, что еще нужно сделать и какие шаги зависят от других». Между тем, «Опыт» фиксирует уроки, например, отзывы пользователей об ошибках, чтобы направлять дальнейшие действия.

Тот же принцип применим и к финансам, сказал Нин. Во время аудита соответствия компания Belief может описать применимые правила и имеющиеся доказательства. Система отслеживания прогресса показывает, какие проверки были завершены, а какие исключения остаются невыполненными. Опыт помогает агенту выявлять повторяющиеся несоответствия или понимать, когда следует передать вопрос на рассмотрение вышестоящим инстанциям.

«В совокупности эти состояния помогают предотвратить потерю агентом контроля над своей работой или повторение одной и той же неудачной попытки», — сказал Нин.

тренировочный конвейер EvoHarness-RL

Чтобы научить агента как механике, так и стратегии управления своим внешним рабочим пространством, исследователи разработали двухэтапный алгоритм обучения. На первом этапе, контролируемой тонкой настройке системы, базовая модель учится извлекать и структурировать полезные данные из неструктурированных журналов взаимодействий в рамках BPE-фреймворка.

Однако запросы к памяти или обновление трекеров требуют времени и вычислительных ресурсов, а это значит, что агент не может позволить себе слепо проверять свои инструменты на каждом шаге. Для решения этой проблемы на втором этапе используется «ориентированное на стоимость» обучение с подкреплением, чтобы научить агента эффективности. На этом этапе агент учится вычислять, когда доступ к его внешнему состоянию оправдан с точки зрения затрат бюджета. Этот двухэтапный процесс преобразует использование инструментов из жестко заданного, заданного подсказки в поведение, выученное во время выполнения.

EvoHarness-RL в действии

Для проверки работоспособности EvoHarness-RL исследователи оценили систему с помощью бенчмарка ALFWorld, текстовой среды, содержащей многоэтапные задачи, проверяющие последовательную логику и отслеживание состояний.

В качестве базовой модели для обучения они использовали Qwen3-8B. Команда сравнила обученную модель 8B с тремя крупными перспективными моделями (Claude Opus 4.5, GPT-4.1 и GPT-5), фреймворками с фиксированными агентами и статическими инструментами (такими как ReAct, ExpeL и ReasoningBank), а также с продвинутыми обучаемыми методами (например, стандартными GRPO, SkillOS и SkillRL).

Результаты показывают значительный скачок в производительности для более компактных и экономичных моделей. С использованием EvoHarness-RL модель Qwen3-8B достигла среднего показателя успешности 96,9%, что на 49,0 процентных пунктов выше, чем у ее базового аналога ReAct.

Кроме того, обученная модель превзошла по производительности продвинутые обучаемые фреймворки, такие как SkillRL (89,9%) и SkillOS (80,2%). Что особенно впечатляет корпоративных разработчиков, стремящихся оптимизировать вычислительные затраты, так это то, что модель 8B фактически достигла потолка производительности дорогостоящих закрытых моделей, таких как Claude Opus 4.5, которая показала результат 96,4% без дополнительных настроек.

Помимо расширения возможностей более мелких моделей, эксперименты показывают, что структура BPE имеет универсальные преимущества для всех масштабов моделей, даже без фазы обширного обучения с подкреплением. Когда исследователи оснастили замороженные, стандартные модели с граничными условиями инструментом BPE для обработки запросов в режиме реального времени, их производительность значительно улучшилась. Показатель успешности GPT-4.1 повысился на 22,1 пункта, а GPT-5 — на 25,7 пункта.

Помимо результатов, исследователи зафиксировали в ходе экспериментов эффекты, демонстрирующие динамическое поведение, которое приобретают LLM-ы в процессе обучения с помощью EvoHarness-RL. На этапе обучения с подкреплением они наблюдали изменение поведения по мере того, как агент усваивал знания с течением времени, что они назвали «отжигом с помощью системы Harness».

На ранних этапах обучения ИИ активно использовал запросы к своим трекерам опыта и прогресса практически на каждом шаге. Однако, освоив рутинные действия, он активно сократил свою зависимость от внешних инструментов, внедряя успешные шаблоны непосредственно в свои параметры. В реальных условиях предприятия это напрямую приводит к снижению задержки и уменьшению вычислительных затрат. Сокращая использование инструментов, ИИ перестает тратить токены и время на запросы к базам данных для стандартных рабочих процессов, которые он уже освоил.

отжиг жгутов

Одновременно агент продемонстрировал «эволюцию использования инструментов», динамически адаптируя свою стратегию в зависимости от сложности ситуации. Хотя для простых, привычных задач он обходил свои инструменты, он активно расширял использование модулей «Убеждения» и «Опыт» в тот момент, когда сталкивался с новыми условиями или неожиданными препятствиями. Например, если ИИ-агент мигрирует стандартные записи базы данных, он делает это быстро. При обнаружении странной устаревшей конечной точки API или сложной ошибки валидации он замедляется, просматривает журналы сервера в реальном времени и запрашивает историю обращений, чтобы безопасно разрешить частный случай, вместо того чтобы строить предположения.

Интеграция EvoHarness-RL в существующие системы.

Несмотря на эти значительные преимущества, внедрение новой платформы часто создает сложности для инженерных команд предприятий. Однако EvoHarness-RL использует адаптер среды, который позволяет внутренним реализациям оставаться специфичными для существующего инструментария организации, одновременно используя общий обучаемый слой.

«Я думаю, что существует значительный потенциал для интеграции BPE в существующие системы оркестровки», — сказал Нин. «Это не обязательно требует от команд замены существующих инструментов или фреймворков агентов. BPE может работать как дополнительный уровень управления состоянием, который постоянно организует текущие убеждения агента, его прогресс и полученные знания».

Для разработчиков корпоративных решений, обеспокоенных затратами на вывод информации, данная платформа решает проблему скрытых инженерных издержек, связанных с консолидацией. Поскольку консолидация требует веских аргументов, команды могут использовать гибридную асинхронную архитектуру для оптимизации бюджетов.

«Одним из возможных компромиссов является использование модели границы для генерации высококачественных данных консолидации, а затем доработка эффективной модели с открытыми весами для обработки рутинного управления состоянием», — сказал Нин. Кроме того, «поскольку консолидация может происходить асинхронно, это не всегда должно замедлять основной цикл выполнения агента».

Команды также должны тщательно оценивать, когда использование обучаемой системы BPE необходимо, а когда это излишне.

«Для краткосрочных и стабильных задач ReAct или стандартный RAG могут быть уже достаточными», — сказал Нин. «BPE становится гораздо ценнее, когда агент работает много часов, дней или даже недель». В таких сложных сценариях агенту необходимо четкое понимание принимаемых решений, чтобы не заблудиться, полагаясь на опыт, позволяющий итеративно совершенствоваться на основе предыдущих неудач и обратной связи от людей.

В конечном итоге, такой подход сигнализирует о сдвиге в подходах инженеров по оркестровке ИИ. «Это не полная замена проектирования рабочих процессов, — сказал Нин, — а переход от непосредственного написания сценариев поведения агентов к созданию систем, в которых можно обучаться более эффективному поведению».

Источник: venturebeat.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники EXL приобретает разработчика физических моделей искусственного интеллекта iMerit Новости робототехники Как Locus решает одну из самых больших робототехнических задач: манипулировать Новости робототехники Мастерская Лу Баня отражает практическое содержание инициативы «Пояс и путь» Архив рубрики ~Коротко из Telegram~ Zero — open-source альтернатива Claude Code в терминале Нашли Zero… Архив рубрики ~Коротко из Telegram~ Инди-игру теперь можно собрать за пару промптов На GitHub выложили… Архив рубрики ~Коротко из Telegram~ Apple показала новые Mac для локального ИИ Apple представила новое… Архив рубрики ~Коротко из Telegram~ Смотреть обязательно до конца, именно там основной пятничный позитивчик 😉… Архив рубрики ~Коротко из Telegram~ По предложению Минцифры РФ – услуги 5G должны быть запущены… Архив рубрики ~Коротко из Telegram~ BMW НЕ СОБИРАЕТСЯ возвращать физические кнопки. В компании делают ставку… Архив рубрики ~Коротко из Telegram~ Все чаты из CS2 УТЕКЛИ в общий доступ — сайт… Архив рубрики ~Коротко из Telegram~ Полезная фишка в Claude Code! Если менять модель через команду… Архив рубрики ~Коротко из Telegram~ GTA 6 уже слишком похожа на реальную жизнь Rockstar показала… Архив рубрики ~Коротко из Telegram~ Nemotron VoiceChat Полнодуплексная речевая модель 11B параметров от NVIDIA, первая… Архив рубрики ~Коротко из Telegram~ Нашли сайт с сотнями бесплатных инструментов На одной платформе собраны… Новости робототехники EXL приобретает разработчика физических моделей искусственного интеллекта iMerit Новости робототехники Как Locus решает одну из самых больших робототехнических задач: манипулировать Новости робототехники Мастерская Лу Баня отражает практическое содержание инициативы «Пояс и путь» Архив рубрики ~Коротко из Telegram~ Zero — open-source альтернатива Claude Code в терминале Нашли Zero… Архив рубрики ~Коротко из Telegram~ Инди-игру теперь можно собрать за пару промптов На GitHub выложили… Архив рубрики ~Коротко из Telegram~ Apple показала новые Mac для локального ИИ Apple представила новое… Архив рубрики ~Коротко из Telegram~ Смотреть обязательно до конца, именно там основной пятничный позитивчик 😉… Архив рубрики ~Коротко из Telegram~ По предложению Минцифры РФ – услуги 5G должны быть запущены… Архив рубрики ~Коротко из Telegram~ BMW НЕ СОБИРАЕТСЯ возвращать физические кнопки. В компании делают ставку… Архив рубрики ~Коротко из Telegram~ Все чаты из CS2 УТЕКЛИ в общий доступ — сайт… Архив рубрики ~Коротко из Telegram~ Полезная фишка в Claude Code! Если менять модель через команду… Архив рубрики ~Коротко из Telegram~ GTA 6 уже слишком похожа на реальную жизнь Rockstar показала… Архив рубрики ~Коротко из Telegram~ Nemotron VoiceChat Полнодуплексная речевая модель 11B параметров от NVIDIA, первая… Архив рубрики ~Коротко из Telegram~ Нашли сайт с сотнями бесплатных инструментов На одной платформе собраны…

Оставить комментарий