Четыре агента ИИ, координирующие действия в реальном времени, превзошли Claude Opus 4.8 в задачах корпоративного программирования.
Бен Диксон
По мере роста корпоративных кодовых баз, ИИ-агенты, которым поручено их анализировать, не справляются с долгосрочными задачами, требующими многочисленных взаимодействий и вызовов инструментов. Разделение работы между командой агентов кажется очевидным решением, но оно вносит фатальный недостаток: большинство многоагентных систем не предназначены для координации действий агентов в процессе выполнения задачи и в режиме реального времени.
Для решения этой проблемы исследователи из Coral AI Labs и ряда университетов представили AgentRadio — асинхронный слой передачи сообщений, который позволяет агентам обмениваться данными между этапами выполнения, не прерывая основную работу. В реальных корпоративных приложениях, где подзадачи сильно взаимозависимы, эта архитектура позволяет агентам вносить корректировки в процессе работы, а не продолжать движение по тупиковым путям до этапа формального анализа.
В ходе сравнительного анализа долгосрочных задач, решаемых на основе производственных репозиториев, команда агентов, использующая AgentRadio, почти вдвое повысила точность выполнения задачи для четырех агентов Claude Code, работающих независимо друг от друга. Она также превзошла результаты отдельных агентов, работающих с более сложными моделями. Для специалистов в области ИИ AgentRadio демонстрирует, что правильная структура координации может превзойти возможности вычислительных ресурсов и масштаб моделей.
Проблема понимания кодовой базы
Агенты на основе LLM все чаще способны справляться с задачами, рассчитанными на длительный период и требующими взаимодействия с различными инструментами и средами. Понимание кодовой базы представляет собой крайний вариант этой задачи. Оно требует от ИИ-агента создания программного обеспечения, его выполнения, отслеживания путей выполнения в нескольких файлах и синтеза данных за длительные периоды времени.
В таких условиях одноагентные системы обычно дают сбой из-за «проблемы покрытия».
«Один агент следует одному последовательному пути через хранилище данных», — объяснили VentureBeat Синьсин Рен, Каэлум Фордер и Питер Кэрролл, соавторы статьи об AgentRadio. По мере расширения контекста «первоначальный план становится сложнее корректировать, а открытия, сделанные на поздних этапах расследования, не всегда распространяются дальше». Модель обычно может выполнять отдельные шаги, но «самая сложная задача — поддерживать активность всех обязательств, зависимостей и противоречивых доказательств на протяжении длительного расследования».
Одним из бенчмарков, помогающих оценить производительность ИИ на больших кодовых базах, является SWE-Atlas QnA. Этот бенчмарк состоит из долгосрочных вопросов на естественном языке, заданных в реальных производственных репозиториях. Задачи нельзя решить, просто изучив код. Агенты ИИ должны запустить программное обеспечение и выполнить множество команд, чтобы найти ответы.
Согласно экспериментам исследовательской группы, один экземпляр Claude Code, работающий на Opus 4.6, решает лишь 32,3% этих задач. Переход на более новую, продвинутую модель, такую как Opus 4.8, обеспечивает лишь 57,2% успеха.
Естественным решением является распределение рабочей нагрузки между несколькими агентами, позволяющее каждому работать в меньшем, более компактном контексте. Многоагентные решения могут обеспечить существенное повышение производительности, если задачи легко декомпозируемы, то есть их можно решать по отдельности и объединять в конце.
Однако понимание кодовой базы редко поддается четкой декомпозиции. Подзадачи сильно взаимозависимы. Критически важный конфигурационный файл или ошибка, обнаруженная одним агентом, может полностью изменить или перенаправить весь путь исследования другого агента. Из-за этих зависимостей агенты должны координировать свои действия, согласовывать и обмениваться промежуточными открытиями в режиме реального времени.

Несмотря на эту потребность, асинхронная многоагентная связь встречается редко. Исследователи отмечают, что существующие многоагентные системы, как правило, попадают в три ошибочных шаблона:
-
Параллельные, но изолированные: агенты действуют одновременно, но не общаются друг с другом.
-
Параллельная, но синхронизированная по раундам система: агенты могут обмениваться информацией, но только в строго синхронизированных рамках раундов. Это вынуждает агентов останавливаться и ждать, пока другой агент завершит раунд, прежде чем они смогут обсудить или обменяться промежуточными результатами. Системы, основанные на раундах, предполагают, что важные открытия могут подождать до следующей фазы обмена информацией, что является дорогостоящим предположением, когда агенты работают над взаимозависимыми частями работающей системы. Например, агент, исследующий симптом API, может обнаружить доказательства, которые опровергают текущую гипотезу агента хранения. «Если эта информация будет получена только после завершения работы обоих агентов, исследование хранилища может завершиться по неверному пути», — заявили исследователи.
-
Асинхронность в смежных формах: Эти системы предлагают ограниченные асинхронные возможности, такие как нисходящая диспетчеризация задач. В них отсутствуют одноранговые каналы связи между агентами или общая память, требующая от агента активной приостановки работы для чтения обновлений.
В своей статье исследователи указывают на то, что основным препятствием для современных многоагентных систем является то, что «агент, который работает, не может одновременно и слушать».
«Насколько нам известно, ни одна из существующих систем не обеспечивает одновременно работающим агентам пассивное взаимодействие по каналу связи на основе естественного языка», — пишут исследователи.
Как работает AgentRadio
Чтобы устранить взаимное отчуждение между работой и прослушиванием, исследователи разработали AgentRadio — асинхронный слой передачи сообщений, предназначенный для прямой интеграции с существующими системами обработки кода.
AgentRadio оснащает агентов тремя базовыми функциями:
-
Примитив create_thread открывает диалог между участвующими агентами.
-
Примитив send_message добавляет сообщение в поток и возвращает управление, не блокируя отправляющий агент.
-
Примитив wait_for_mention блокирует процесс до тех пор, пока не поступит сообщение с упоминанием вызывающего объекта. Он доставляет сообщение вместе с полным снимком всех потоков, чтобы агент имел мгновенный контекст.
Эта тройка позволяет агентам находиться в состоянии «пассивного осознания», когда они могут продолжать выполнять свои основные задачи, передавая сообщения и обновляя свои знания в фоновом режиме.
Код AgentRadio доступен на GitHub под лицензией Apache 2.0. Он разработан как легковесный продукт, не требующий прямых изменений в базовых агентских средах, таких как Claude Code или Codex CLI.

Архитектура состоит из двух основных частей:
-
Сервер сообщений: автономный процесс, выступающий в качестве центрального узла, хранящий все активные ветки обсуждений, сообщения и упоминания для группы агентов.
-
Интеграция на стороне сервера: Агенты взаимодействуют с сервером, используя три простых скрипта оболочки, по одному для каждого примитива.
Единственное строгое требование для работы системы — это возможность запуска команд оболочки в фоновом режиме на стороне агента. В системных подсказках агентам дается указание поддерживать работу одного наблюдателя и отправлять сообщения через предоставленные скрипты. Запуск скрипта wait_for_mention в фоновом режиме позволяет агенту продолжать свою работу и получать уведомления асинхронно.
Для интеграции этого в существующий стек команде по-прежнему необходим «тонкий адаптер, который запускает рабочие процессы, назначает идентификаторы, подключает их к общему серверу и управляет окончательным синтезом», — заявили исследователи. Эта работа выполняется вокруг агента кодирования, а не требует изменений в базовой модели.
AgentRadio в действии
Для подтверждения практической полезности AgentRadio исследователи протестировали фреймворк на 124 задачах из бенчмарка SWE-Atlas QnA. Тесты охватывали такие области, как проектирование системы, анализ первопричин, безопасность и интеграция API.
В качестве базовых моделей исследователи использовали Claude Opus 4.6 и DeepSeek V4 Pro. Для тестирования они оценивали конфигурации, начиная от одного агента Claude Code (B0) до команды агентов с классическим разделением труда (L1) и заканчивая командой агентов, использующих AgentRadio для асинхронной координации (L3).
Результаты экспериментов показали, что архитектура связи AgentRadio превосходит как простые многоагентные конфигурации, так и масштабируемость вычислительных ресурсов.
В то время как один агент Claude Code с Opus 4.6 выполнил лишь 32,3% задач, полная настройка AgentRadio почти вдвое улучшила этот показатель, выполнив 62,1% задач, и превзошла результат одного агента, работающего на Opus 4.8, который достиг 57,2%. Это также повысило результаты DeepSeek V4 Pro с 29,0% до 50,8%.

Чтобы понять, как это практически влияет на корпоративный ИИ, в статье рассматривается реальная задача, связанная с системой MinIO. Для решения этой задачи потребовалась проверка серверных журналов по каждому запросу, что агенты не предусмотрели на этапе первоначального планирования.
В условиях второго уровня сложности, когда агенты сотрудничают, но отсутствует асинхронная связь, два агента независимо друг от друга поняли, что им необходимы эти журналы во время выполнения команд. Поскольку они не могли поделиться этим открытием в процессе выполнения, один агент сдался в частном порядке, а другой не предложил это команде. На этапе проверки команда единогласно пришла к выводу о неверном ответе, пропустив пять критериев оценки.
При активированном AgentRadio агенты обнаружили проблему в процессе выполнения, но один из них мгновенно передал необходимые данные из серверного лога в общий рабочий журнал. Поскольку другие агенты пассивно прослушивали, они немедленно усвоили эти новые данные. Такая координация в реальном времени превратила неудачную оценку в идеальную — 16 из 16.
«Важное различие заключается во времени», — заявили исследователи. «Команде не понадобился еще один агент или еще один раунд проверки. Необходимо было, чтобы открытие одного агента дошло до нужных коллег до того, как его практическая ценность исчерпается».

Исследователи отмечают, что аналогичная закономерность наблюдается и в работе с инцидентами на предприятиях. Например, агент, расследующий проблему с API, может обнаружить доказательства, опровергающие текущую гипотезу агента хранилища. Если эта информация будет получена только после завершения работы обоих агентов, расследование проблемы хранилища может завершиться по неверному пути. «Пассивное отслеживание позволяет второму агенту учесть противоречие на следующем этапе работы, не прерывая уже выполняемую команду», — заявили они.
Стоимость и сложность координации
AgentRadio требует фиксированного бюджета для команды из нескольких агентов, что неизбежно увеличивает стоимость токенов. Исследователи признают, что «налог реален», отмечая, что средние затраты на API выросли с 2,96 долларов за задачу для одного агента Opus до 19,45 долларов для всего стека AgentRadio.
Однако масштаб не равен производительности. Когда исследователи сравнили результаты тестирования, потратив 17,76 долларов на шесть независимых запусков Opus, модели справились только с 37,9% задач, по сравнению с 62,1% для AgentRadio. Это говорит о том, что архитектура AgentRadio — это структурное преимущество, а не просто преимущество за счет масштабируемости. Командам все же следует помнить о смене агентов. «Общение может перенаправить агента к более достоверным данным, а также отвлечь его от правильного пути», — предупредили исследователи.
Не следует превращать фиксированную многоагентную команду в стандартный ответ на каждую инженерную задачу. Более полезным критерием для определения необходимости многоагентной команды является наличие в задаче «точек разрыва в распределении ответственности», — заявили исследователи. Это места, «где компетентный инженер привлечет другого человека, поскольку работа выходит за рамки ответственности, требует независимой гипотезы или несет достаточно высокий риск, чтобы оправдать отдельную проверку».
«Координация хорошо подходит, когда задачу можно декомпозировать, получающиеся части остаются взаимозависимыми, показатель успешности работы одного агента ненадежен, а неполный ответ влечет за собой значительные последующие затраты», — заявили исследователи. Примеры включают вопросы архитектуры в масштабе всего репозитория, незнакомые устаревшие системы, расследование инцидентов между сервисами, анализ безопасности, миграцию зависимостей и рефакторинг нескольких модулей.
И наоборот, использование одного агента остается более предпочтительным вариантом для «ограниченной, локальной и обратимой работы», например, для известного изменения одного файла или генерации шаблонного кода.
«Используйте одного агента, пока один контекст может честно нести ответственность за проблему», — заявили исследователи. «Вводите другую ответственность, когда существующему агенту в противном случае пришлось бы сжимать доказательства, пересекать границу независимой ответственности или проверять свой собственный важный вывод».
От исследований к коммерциализации: Коралловый код
В то время как AgentRadio представляет собой контролируемый исследовательский проект, использующий фиксированную команду из четырех агентов и пятифазный протокол, лежащие в его основе принципы адаптированы для коммерческого продукта под названием Coral Code.
Вместо жесткого многоагентного протокола, применяемого к каждому запросу, Coral Code работает снизу вверх. Инженер начинает с уже имеющегося у него агента кодирования, а Coral вводит расследование в рамках репозитория, ответственность специалистов и коммуникацию только тогда, когда это оправдано появляющимися доказательствами. «Coral объединяет операционные задачи с инструментами, которые уже используют инженеры, предоставляя контекст репозитория, специалистов, отвечающих за определенные задачи, коммуникацию и уровень доказательств вокруг системы, а не внутри нее», — заявили исследователи.
Этот динамический подход оптимизирует затраты, ориентируясь на соответствующую единицу измерения: стоимость завершенного, подлежащего проверке результата.
Будущее автономной разработки программного обеспечения
Хотя AgentRadio представляет собой значительное улучшение в области оркестрации агентов, всё ещё существуют препятствия, которые необходимо преодолеть. Одним из главных узких мест, на которое указали исследователи, является «управление вниманием и проверка».
«Пассивное отслеживание обеспечивает связь во время выполнения. Оно не определяет, какие агенты должны существовать, какое открытие заслуживает прерывания, кто должен его получить или когда доказательства становятся достаточно убедительными для пересмотра плана», — заявили исследователи. Если каждый агент получает каждое обновление, слой связи превращается в шум. Если несколько агентов разделяют одно и то же ошибочное предположение, более быстрая связь может распространить ошибку.
Например, в одном из тематических исследований, описанных в статье и посвященных платформе Grafana, четыре из девяти критериев требовали отрицательных выводов, таких как наблюдение за тем, что средство выбора источника данных не выбирает данные автоматически. Агенты провели соответствующие тесты, но ни один из них не сформулировал недостающую отрицательную гипотезу. Обе конфигурации не прошли проверку по четырем критериям.
«Пассивное осознание может распространять идею, которую кто-то сам разработал. Оно не может предложить концепцию, которая никогда не появлялась бы нигде в команде», — заявили исследователи.
По мере увеличения продолжительности задач коммуникация и координация становятся критически важными. «Системам следующего поколения… необходимы адаптивное распределение ответственности, маршрутизация с учетом доказательств, разрешение конфликтов, четко определенные ограничения по стоимости, разрешения, восстановление и ясные точки эскалации со стороны человека», — отмечают исследователи. Самое важное — это надежная система отслеживания происхождения данных, позволяющая руководителям инженерных групп проверять, какой агент предъявил претензию и почему действие было принято.
«Более длительный срок службы агентов повышает важность коммуникации. Кроме того, они значительно затрудняют подделку ответственности», — заявили они.
Источник: venturebeat.com
Похожие записи
Оцените материал:
Похожие записи
Процессоры Intel Nova Lake для периферийного сегмента могут получить только E-ядра
25.05.2026
Цель миссии НАСА «Артемида II» — вернуть астронавтов на Луну в 2026 году.
31.12.2025
Хакеры взломали популярный текстовый редактор Notepad++ и полгода распространяли вирусы с обновлениями
06.02.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
