Архив рубрики ~Лента новостей~

Четыре агента ИИ, координирующие действия в реальном времени, превзошли Claude Opus 4.8 в задачах корпоративного программирования.

Четыре агента ИИ, координирующие действия в реальном времени, превзошли Claude Opus 4.8 в задачах корпоративного программирования.
Четыре агента ИИ, координирующие действия в реальном времени, превзошли Claude Opus 4.8 в задачах корпоративного программирования.

Бен Диксон

По мере роста корпоративных кодовых баз, ИИ-агенты, которым поручено их анализировать, не справляются с долгосрочными задачами, требующими многочисленных взаимодействий и вызовов инструментов. Разделение работы между командой агентов кажется очевидным решением, но оно вносит фатальный недостаток: большинство многоагентных систем не предназначены для координации действий агентов в процессе выполнения задачи и в режиме реального времени.

Для решения этой проблемы исследователи из Coral AI Labs и ряда университетов представили AgentRadio — асинхронный слой передачи сообщений, который позволяет агентам обмениваться данными между этапами выполнения, не прерывая основную работу. В реальных корпоративных приложениях, где подзадачи сильно взаимозависимы, эта архитектура позволяет агентам вносить корректировки в процессе работы, а не продолжать движение по тупиковым путям до этапа формального анализа.

В ходе сравнительного анализа долгосрочных задач, решаемых на основе производственных репозиториев, команда агентов, использующая AgentRadio, почти вдвое повысила точность выполнения задачи для четырех агентов Claude Code, работающих независимо друг от друга. Она также превзошла результаты отдельных агентов, работающих с более сложными моделями. Для специалистов в области ИИ AgentRadio демонстрирует, что правильная структура координации может превзойти возможности вычислительных ресурсов и масштаб моделей.

Проблема понимания кодовой базы

Агенты на основе LLM все чаще способны справляться с задачами, рассчитанными на длительный период и требующими взаимодействия с различными инструментами и средами. Понимание кодовой базы представляет собой крайний вариант этой задачи. Оно требует от ИИ-агента создания программного обеспечения, его выполнения, отслеживания путей выполнения в нескольких файлах и синтеза данных за длительные периоды времени.

В таких условиях одноагентные системы обычно дают сбой из-за «проблемы покрытия».

«Один агент следует одному последовательному пути через хранилище данных», — объяснили VentureBeat Синьсин Рен, Каэлум Фордер и Питер Кэрролл, соавторы статьи об AgentRadio. По мере расширения контекста «первоначальный план становится сложнее корректировать, а открытия, сделанные на поздних этапах расследования, не всегда распространяются дальше». Модель обычно может выполнять отдельные шаги, но «самая сложная задача — поддерживать активность всех обязательств, зависимостей и противоречивых доказательств на протяжении длительного расследования».

Одним из бенчмарков, помогающих оценить производительность ИИ на больших кодовых базах, является SWE-Atlas QnA. Этот бенчмарк состоит из долгосрочных вопросов на естественном языке, заданных в реальных производственных репозиториях. Задачи нельзя решить, просто изучив код. Агенты ИИ должны запустить программное обеспечение и выполнить множество команд, чтобы найти ответы.

Согласно экспериментам исследовательской группы, один экземпляр Claude Code, работающий на Opus 4.6, решает лишь 32,3% этих задач. Переход на более новую, продвинутую модель, такую как Opus 4.8, обеспечивает лишь 57,2% успеха.

Естественным решением является распределение рабочей нагрузки между несколькими агентами, позволяющее каждому работать в меньшем, более компактном контексте. Многоагентные решения могут обеспечить существенное повышение производительности, если задачи легко декомпозируемы, то есть их можно решать по отдельности и объединять в конце.

Однако понимание кодовой базы редко поддается четкой декомпозиции. Подзадачи сильно взаимозависимы. Критически важный конфигурационный файл или ошибка, обнаруженная одним агентом, может полностью изменить или перенаправить весь путь исследования другого агента. Из-за этих зависимостей агенты должны координировать свои действия, согласовывать и обмениваться промежуточными открытиями в режиме реального времени.

изображение2

Несмотря на эту потребность, асинхронная многоагентная связь встречается редко. Исследователи отмечают, что существующие многоагентные системы, как правило, попадают в три ошибочных шаблона:

  • Параллельные, но изолированные: агенты действуют одновременно, но не общаются друг с другом.

  • Параллельная, но синхронизированная по раундам система: агенты могут обмениваться информацией, но только в строго синхронизированных рамках раундов. Это вынуждает агентов останавливаться и ждать, пока другой агент завершит раунд, прежде чем они смогут обсудить или обменяться промежуточными результатами. Системы, основанные на раундах, предполагают, что важные открытия могут подождать до следующей фазы обмена информацией, что является дорогостоящим предположением, когда агенты работают над взаимозависимыми частями работающей системы. Например, агент, исследующий симптом API, может обнаружить доказательства, которые опровергают текущую гипотезу агента хранения. «Если эта информация будет получена только после завершения работы обоих агентов, исследование хранилища может завершиться по неверному пути», — заявили исследователи.

  • Асинхронность в смежных формах: Эти системы предлагают ограниченные асинхронные возможности, такие как нисходящая диспетчеризация задач. В них отсутствуют одноранговые каналы связи между агентами или общая память, требующая от агента активной приостановки работы для чтения обновлений.

В своей статье исследователи указывают на то, что основным препятствием для современных многоагентных систем является то, что «агент, который работает, не может одновременно и слушать».

«Насколько нам известно, ни одна из существующих систем не обеспечивает одновременно работающим агентам пассивное взаимодействие по каналу связи на основе естественного языка», — пишут исследователи.

Как работает AgentRadio

Чтобы устранить взаимное отчуждение между работой и прослушиванием, исследователи разработали AgentRadio — асинхронный слой передачи сообщений, предназначенный для прямой интеграции с существующими системами обработки кода.

AgentRadio оснащает агентов тремя базовыми функциями:

  • Примитив create_thread открывает диалог между участвующими агентами.

  • Примитив send_message добавляет сообщение в поток и возвращает управление, не блокируя отправляющий агент.

  • Примитив wait_for_mention блокирует процесс до тех пор, пока не поступит сообщение с упоминанием вызывающего объекта. Он доставляет сообщение вместе с полным снимком всех потоков, чтобы агент имел мгновенный контекст.

Эта тройка позволяет агентам находиться в состоянии «пассивного осознания», когда они могут продолжать выполнять свои основные задачи, передавая сообщения и обновляя свои знания в фоновом режиме.

Код AgentRadio доступен на GitHub под лицензией Apache 2.0. Он разработан как легковесный продукт, не требующий прямых изменений в базовых агентских средах, таких как Claude Code или Codex CLI.

Архитектура AgentRadio

Архитектура состоит из двух основных частей:

  • Сервер сообщений: автономный процесс, выступающий в качестве центрального узла, хранящий все активные ветки обсуждений, сообщения и упоминания для группы агентов.

  • Интеграция на стороне сервера: Агенты взаимодействуют с сервером, используя три простых скрипта оболочки, по одному для каждого примитива.

Единственное строгое требование для работы системы — это возможность запуска команд оболочки в фоновом режиме на стороне агента. В системных подсказках агентам дается указание поддерживать работу одного наблюдателя и отправлять сообщения через предоставленные скрипты. Запуск скрипта wait_for_mention в фоновом режиме позволяет агенту продолжать свою работу и получать уведомления асинхронно.

Для интеграции этого в существующий стек команде по-прежнему необходим «тонкий адаптер, который запускает рабочие процессы, назначает идентификаторы, подключает их к общему серверу и управляет окончательным синтезом», — заявили исследователи. Эта работа выполняется вокруг агента кодирования, а не требует изменений в базовой модели.

AgentRadio в действии

Для подтверждения практической полезности AgentRadio исследователи протестировали фреймворк на 124 задачах из бенчмарка SWE-Atlas QnA. Тесты охватывали такие области, как проектирование системы, анализ первопричин, безопасность и интеграция API.

В качестве базовых моделей исследователи использовали Claude Opus 4.6 и DeepSeek V4 Pro. Для тестирования они оценивали конфигурации, начиная от одного агента Claude Code (B0) до команды агентов с классическим разделением труда (L1) и заканчивая командой агентов, использующих AgentRadio для асинхронной координации (L3).

Результаты экспериментов показали, что архитектура связи AgentRadio превосходит как простые многоагентные конфигурации, так и масштабируемость вычислительных ресурсов.

В то время как один агент Claude Code с Opus 4.6 выполнил лишь 32,3% задач, полная настройка AgentRadio почти вдвое улучшила этот показатель, выполнив 62,1% задач, и превзошла результат одного агента, работающего на Opus 4.8, который достиг 57,2%. Это также повысило результаты DeepSeek V4 Pro с 29,0% до 50,8%.

AgentRadio против систем с одним агентом

Чтобы понять, как это практически влияет на корпоративный ИИ, в статье рассматривается реальная задача, связанная с системой MinIO. Для решения этой задачи потребовалась проверка серверных журналов по каждому запросу, что агенты не предусмотрели на этапе первоначального планирования.

В условиях второго уровня сложности, когда агенты сотрудничают, но отсутствует асинхронная связь, два агента независимо друг от друга поняли, что им необходимы эти журналы во время выполнения команд. Поскольку они не могли поделиться этим открытием в процессе выполнения, один агент сдался в частном порядке, а другой не предложил это команде. На этапе проверки команда единогласно пришла к выводу о неверном ответе, пропустив пять критериев оценки.

При активированном AgentRadio агенты обнаружили проблему в процессе выполнения, но один из них мгновенно передал необходимые данные из серверного лога в общий рабочий журнал. Поскольку другие агенты пассивно прослушивали, они немедленно усвоили эти новые данные. Такая координация в реальном времени превратила неудачную оценку в идеальную — 16 из 16.

«Важное различие заключается во времени», — заявили исследователи. «Команде не понадобился еще один агент или еще один раунд проверки. Необходимо было, чтобы открытие одного агента дошло до нужных коллег до того, как его практическая ценность исчерпается».

AgentRadio в действии

Исследователи отмечают, что аналогичная закономерность наблюдается и в работе с инцидентами на предприятиях. Например, агент, расследующий проблему с API, может обнаружить доказательства, опровергающие текущую гипотезу агента хранилища. Если эта информация будет получена только после завершения работы обоих агентов, расследование проблемы хранилища может завершиться по неверному пути. «Пассивное отслеживание позволяет второму агенту учесть противоречие на следующем этапе работы, не прерывая уже выполняемую команду», — заявили они.

Стоимость и сложность координации

AgentRadio требует фиксированного бюджета для команды из нескольких агентов, что неизбежно увеличивает стоимость токенов. Исследователи признают, что «налог реален», отмечая, что средние затраты на API выросли с 2,96 долларов за задачу для одного агента Opus до 19,45 долларов для всего стека AgentRadio.

Однако масштаб не равен производительности. Когда исследователи сравнили результаты тестирования, потратив 17,76 долларов на шесть независимых запусков Opus, модели справились только с 37,9% задач, по сравнению с 62,1% для AgentRadio. Это говорит о том, что архитектура AgentRadio — это структурное преимущество, а не просто преимущество за счет масштабируемости. Командам все же следует помнить о смене агентов. «Общение может перенаправить агента к более достоверным данным, а также отвлечь его от правильного пути», — предупредили исследователи.

Не следует превращать фиксированную многоагентную команду в стандартный ответ на каждую инженерную задачу. Более полезным критерием для определения необходимости многоагентной команды является наличие в задаче «точек разрыва в распределении ответственности», — заявили исследователи. Это места, «где компетентный инженер привлечет другого человека, поскольку работа выходит за рамки ответственности, требует независимой гипотезы или несет достаточно высокий риск, чтобы оправдать отдельную проверку».

«Координация хорошо подходит, когда задачу можно декомпозировать, получающиеся части остаются взаимозависимыми, показатель успешности работы одного агента ненадежен, а неполный ответ влечет за собой значительные последующие затраты», — заявили исследователи. Примеры включают вопросы архитектуры в масштабе всего репозитория, незнакомые устаревшие системы, расследование инцидентов между сервисами, анализ безопасности, миграцию зависимостей и рефакторинг нескольких модулей.

И наоборот, использование одного агента остается более предпочтительным вариантом для «ограниченной, локальной и обратимой работы», например, для известного изменения одного файла или генерации шаблонного кода.

«Используйте одного агента, пока один контекст может честно нести ответственность за проблему», — заявили исследователи. «Вводите другую ответственность, когда существующему агенту в противном случае пришлось бы сжимать доказательства, пересекать границу независимой ответственности или проверять свой собственный важный вывод».

От исследований к коммерциализации: Коралловый код

В то время как AgentRadio представляет собой контролируемый исследовательский проект, использующий фиксированную команду из четырех агентов и пятифазный протокол, лежащие в его основе принципы адаптированы для коммерческого продукта под названием Coral Code.

Вместо жесткого многоагентного протокола, применяемого к каждому запросу, Coral Code работает снизу вверх. Инженер начинает с уже имеющегося у него агента кодирования, а Coral вводит расследование в рамках репозитория, ответственность специалистов и коммуникацию только тогда, когда это оправдано появляющимися доказательствами. «Coral объединяет операционные задачи с инструментами, которые уже используют инженеры, предоставляя контекст репозитория, специалистов, отвечающих за определенные задачи, коммуникацию и уровень доказательств вокруг системы, а не внутри нее», — заявили исследователи.

Этот динамический подход оптимизирует затраты, ориентируясь на соответствующую единицу измерения: стоимость завершенного, подлежащего проверке результата.

Будущее автономной разработки программного обеспечения

Хотя AgentRadio представляет собой значительное улучшение в области оркестрации агентов, всё ещё существуют препятствия, которые необходимо преодолеть. Одним из главных узких мест, на которое указали исследователи, является «управление вниманием и проверка».

«Пассивное отслеживание обеспечивает связь во время выполнения. Оно не определяет, какие агенты должны существовать, какое открытие заслуживает прерывания, кто должен его получить или когда доказательства становятся достаточно убедительными для пересмотра плана», — заявили исследователи. Если каждый агент получает каждое обновление, слой связи превращается в шум. Если несколько агентов разделяют одно и то же ошибочное предположение, более быстрая связь может распространить ошибку.

Например, в одном из тематических исследований, описанных в статье и посвященных платформе Grafana, четыре из девяти критериев требовали отрицательных выводов, таких как наблюдение за тем, что средство выбора источника данных не выбирает данные автоматически. Агенты провели соответствующие тесты, но ни один из них не сформулировал недостающую отрицательную гипотезу. Обе конфигурации не прошли проверку по четырем критериям.

«Пассивное осознание может распространять идею, которую кто-то сам разработал. Оно не может предложить концепцию, которая никогда не появлялась бы нигде в команде», — заявили исследователи.

По мере увеличения продолжительности задач коммуникация и координация становятся критически важными. «Системам следующего поколения… необходимы адаптивное распределение ответственности, маршрутизация с учетом доказательств, разрешение конфликтов, четко определенные ограничения по стоимости, разрешения, восстановление и ясные точки эскалации со стороны человека», — отмечают исследователи. Самое важное — это надежная система отслеживания происхождения данных, позволяющая руководителям инженерных групп проверять, какой агент предъявил претензию и почему действие было принято.

«Более длительный срок службы агентов повышает важность коммуникации. Кроме того, они значительно затрудняют подделку ответственности», — заявили они.

Источник: venturebeat.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Avatar Robotics собирает начальный раунд для решения проблем с рабочей силой в промышленности Архив рубрики ~Обо всем~ Возникновение сознания в результате распада бикамерального разума Новости робототехники SpaceX и Tesla запланировали инвестировать $16,8 млрд в проект по производству чипов Terafab на начальном этапе, а Илон Маск показал рендеры Новости робототехники Нет облачных вычислений, нет графических процессоров, нет проблем: новая модель LFM2.5-2.6B от Liquid AI предоставляет мощные агенты искусственного интеллекта для устройств размером всего лишь с Raspberry Pi. Новости робототехники Brain Corp сообщает о 68-процентном росте и увеличении 50 000 автономных роботов по всему миру. Архив рубрики ~Коротко из Telegram~ В DeepMind большая перестановка: Хассабис уходит с поста CEO В… Новости робототехники NVIDIA открыла самую крупную модель для беспилотников NVIDIA открыла доступ… Архив рубрики ~Коротко из Telegram~ Google больше не кормит сайты трафиком как раньше Axios снова… Архив рубрики ~Коротко из Telegram~ ИИ уже стал нормой в Java-разработке, но Spring Boot никто… Архив рубрики ~Коротко из Telegram~ ИИ помогает работать быстрее — и быстрее выгорать ИИ всё… Архив рубрики ~Коротко из Telegram~ Вайбкодер собрал интерактивный учебник по анатомии Гений навайбкодил интерактивный учебник… Архив рубрики ~Коротко из Telegram~ МТС встроила ИИ-аналитика в «Геоэффект» МТС добавила ИИ-агента в сервис… Архив рубрики ~Коротко из Telegram~ AirDrop для любых устройств — нашли бесплатный сервис для передачи… Архив рубрики ~Коротко из Telegram~ Вайбкодим в ЛЮБОЙ программе Нашли топовый инструмент CLI Anything, позволяющий… Новости робототехники Avatar Robotics собирает начальный раунд для решения проблем с рабочей силой в промышленности Архив рубрики ~Обо всем~ Возникновение сознания в результате распада бикамерального разума Новости робототехники SpaceX и Tesla запланировали инвестировать $16,8 млрд в проект по производству чипов Terafab на начальном этапе, а Илон Маск показал рендеры Новости робототехники Нет облачных вычислений, нет графических процессоров, нет проблем: новая модель LFM2.5-2.6B от Liquid AI предоставляет мощные агенты искусственного интеллекта для устройств размером всего лишь с Raspberry Pi. Новости робототехники Brain Corp сообщает о 68-процентном росте и увеличении 50 000 автономных роботов по всему миру. Архив рубрики ~Коротко из Telegram~ В DeepMind большая перестановка: Хассабис уходит с поста CEO В… Новости робототехники NVIDIA открыла самую крупную модель для беспилотников NVIDIA открыла доступ… Архив рубрики ~Коротко из Telegram~ Google больше не кормит сайты трафиком как раньше Axios снова… Архив рубрики ~Коротко из Telegram~ ИИ уже стал нормой в Java-разработке, но Spring Boot никто… Архив рубрики ~Коротко из Telegram~ ИИ помогает работать быстрее — и быстрее выгорать ИИ всё… Архив рубрики ~Коротко из Telegram~ Вайбкодер собрал интерактивный учебник по анатомии Гений навайбкодил интерактивный учебник… Архив рубрики ~Коротко из Telegram~ МТС встроила ИИ-аналитика в «Геоэффект» МТС добавила ИИ-агента в сервис… Архив рубрики ~Коротко из Telegram~ AirDrop для любых устройств — нашли бесплатный сервис для передачи… Архив рубрики ~Коротко из Telegram~ Вайбкодим в ЛЮБОЙ программе Нашли топовый инструмент CLI Anything, позволяющий…

Оставить комментарий