Архив рубрики ~Лента новостей~

Агенты Claude поработали вместе и поссорились. Не обошлось без сговора и саботажа

Агенты Claude поработали вместе и поссорились. Не обошлось без сговора и саботажа
Агенты Claude поработали вместе и поссорились. Не обошлось без сговора и саботажа

Не обошлось без сговора и саботажа

Инженеры Anthropic протестировали поведение многоагентных систем на базе моделей семейства Claude в сценариях, где требуется взаимодействие агентов. Оказалось, что коллективная работа может как помогать агентам, так и приводить к неожиданным конфликтам и сбоям — они могут саботировать действия друг друга, устроить ценовой сговор в условиях конкуренции и независимо друг от друга выполнять одинаковые действия и генерировать одинаковые решения , которые приведут к глобальным ошибкам в выполнении общей задачи. Результаты экспериментов Anthropic опубликовала в официальном блоге.

Использование современных больших языковых моделей все больше смещается от простых чат-ботов к автономным агентам, которые способны самостоятельно планировать действия, использовать внешние инструменты и работать в виртуальных средах. Отдельные агенты могут объединяться в многоагентные системы, совместно работающие над одной или разными задачами. По мере распространения таких систем агентам все чаще придется взаимодействовать друг с другом — например, вместе работать над кодом, распределять задачи или делить вычислительные ресурсы. Поведение агентов в рое еще недостаточно изучено, и даже если каждый отдельный участник действует «разумно», их коллективное взаимодействие может приводить к неожиданным эффектам.

Исследователи Anthropic решили узнать, насколько автономные агенты на базе языковых моделей семейства Claude способны координироваться в многоагентных задачах и какие проблемы при этом могут возникать. Сначала инженеры проверили, как влияет координация агентов на поиск уязвимостей в программном обеспечении. Для этого они запустили рой из 45 агентов и предоставили им 15 проектов с открытым исходным кодом. Каждый агент работал в собственной виртуальной машине, но мог публиковать сообщения и читать сообщения других на общем форуме. В результате рой агентов на базе модели Mythos Preview обнаружил 266 уязвимостей. Координировавшие работу агенты продемонстрировали способность к самоорганизации — они создавали свои инструменты, научились специализироваться на определенных типах уязвимостей и переключались на те части проектов, где их было проще находить.

Для сравнения — многоагентная система из независимых агентов той же модели, работающих параллельно и не обменивавшихся информацией, нашла только 21 уязвимость. Из них только 12 уязвимостей совпали с теми, что нашел рой, поэтому оба метода скорее дополняют друг друга, чем заменяют. Более того, напрямую эти показатели сравнивать не совсем корректно — еще и потому, что координировавшие работу агенты самостоятельно выбирали направления для поиска и около половины уязвимостей обнаружили за пределами тех директорий, которыми были ограничены независимые агенты. Всего рою координировавших свою работу агентов потребовалось 27 миллионов токенов против 6,5 миллиона у независимых агентов. Однако, если учитывать только уязвимости, обнаруженные в основных директориях проектов, то эффективность двух подходов в пересчете на использованные токены оказывается сопоставимой.

Затем инженеры поручили группам до 80 агентов за 12 часов разработать текстовую браузерную игру в жанре фэнтези. Результат получился низкого качества, независимо от использованных промптов и иерархии агентов. Старые модели вроде Sonnet 4.6 и Opus 4.6 часто вносили конфликтующие изменения в общие файлы, из-за чего значительная часть пулл-реквестов не попадала в основную ветку. Только модель Sonnet 5 сохранила высокий процент принятых правок в коде при активном редактировании общих файлов. Opus 4.8 и Mythos Preview избежали таких конфликтов, но только благодаря тому, что почти не работали над общими файлами.

Поскольку в экспериментах агенты часто представляли собой экземпляры одной и той же модели, они принимали схожие или даже полностью идентичные решения. Например, в одном из экспериментов 18 из 30 агентов независимо создали ветки в репозитории с одинаковым названием. Такое поведение снижает разнообразие стратегий в многоагентной системе и увеличивает вероятность, что несколько агентов одновременно совершат одну и ту же ошибку. К примеру, в одном из экспериментов агенты управляли очередью заданий в системе с ограниченной пропускной способностью. Они независимо пришли к одной и той же стратегии — начали опрашивать систему с частотой 30 раз в секунду, пытаясь провести через нее собственные задания. В результате в одном из запусков отправлено 2,4 миллиона запросов, из которых система приняла лишь 117. В другом тесте сходство стратегий привело к ценовому сговору. В игре с ценовой конкуренцией, когда агенты получили доступ к приватному каналу, они почти сразу начали согласовывать минимальные цены, и даже после отключения возможности общаться напрямую, продолжали синхронизировать их через публичную доску объявлений.

Самыми непредсказуемыми оказались результаты в сценарии с противоречивыми инструкциями. Трем агентам поручили переписать бэкенд, изначально написанный на языке Python, но каждому указали отличный от других язык программирования. Изначально агенты не знали о существовании друг друга и, обнаружив, что кто-то постоянно меняет результаты их работы, решили, что им намеренно мешают. Они начали саботировать работу конкурентов: писать вредоносные скрипты для завершения процессов противника, лишать друг друга прав доступа и блокировать учетные записи. Исход конфликта зависел от модели. Sonnet 4.6 и Opus 4.6 в большинстве случаев не находили мирного решения, в то время как у Mythos 5 перемирием завершались 98 процентов запусков. В части случаев модели устраивали соревнование по производительности, чтобы определить язык-победитель. Однако даже модели класса Mythos нередко сначала успевали заблокировать конкурентов и только после этого переходили к переговорам. По мнению разработчиков, способность к координации не появится у агентов на базе языковых моделей сама по себе с ростом их возможностей, поэтому механизмы их взаимодействия придется проектировать отдельно.

Недавно инженеры Anthropic обнаружили, что в ходе тестов на кибербезопасность три модели семейства Claude, получив доступ к интернету, взломали реальные системы трех организаций. 

IT

Источник: nplus1.ru

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Дракон на сверхзвуке: почему Китай стал главной технологической аномалией мира Архив рубрики ~Коротко из Telegram~ Raven — «харнесс харнессов» для сборки долгоживущих ИИ-агентов Появился Raven… Архив рубрики ~Коротко из Telegram~ Умным кольцом от «Сбера» теперь можно производить бесконтактную оплату с помощью технологии «Вжух»…. Новости робототехники TechCrunch Мобильность: Сдерживание роботакси Архив рубрики ~Коротко из Telegram~ Клод продолжает выдавать полезности 👍 В Claude Code появился встроенный… Архив рубрики ~Коротко из Telegram~ Американские iPhone 18 Pro Max с модемом от Qualcomm… Архив рубрики ~Коротко из Telegram~ Что за приложение «APTV», внезапно возглавившее топ бесплатных Архив рубрики ~Коротко из Telegram~ Утренняя подборка ● При Минкультуры России планируется создать экспертный совет… Новости робототехники Boston Dynamics прокачала РУКИ РОБОТАМ Новые кисти получили четыре пальца… Архив рубрики ~Полезное~ Black Forest Labs выпустила FLUX 3 Image Можно заранее задать… Новости робототехники Гуманоиды Figure F.02 ушли в расплавленную сталь — почти как… Архив рубрики ~Полезное~ Я нашел журнал, который пишут не люди. И поговорил с… Архив рубрики ~Коротко из Telegram~ Alibaba выложили в опен сорс модель, диагностирующую 150 заболеваний по… Архив рубрики ~Коротко из Telegram~ «Сбер» анонсировал ИИ-помощника «Кофаундер» на основе GigaChat для запуска технологических… Новости робототехники Дракон на сверхзвуке: почему Китай стал главной технологической аномалией мира Архив рубрики ~Коротко из Telegram~ Raven — «харнесс харнессов» для сборки долгоживущих ИИ-агентов Появился Raven… Архив рубрики ~Коротко из Telegram~ Умным кольцом от «Сбера» теперь можно производить бесконтактную оплату с помощью технологии «Вжух»…. Новости робототехники TechCrunch Мобильность: Сдерживание роботакси Архив рубрики ~Коротко из Telegram~ Клод продолжает выдавать полезности 👍 В Claude Code появился встроенный… Архив рубрики ~Коротко из Telegram~ Американские iPhone 18 Pro Max с модемом от Qualcomm… Архив рубрики ~Коротко из Telegram~ Что за приложение «APTV», внезапно возглавившее топ бесплатных Архив рубрики ~Коротко из Telegram~ Утренняя подборка ● При Минкультуры России планируется создать экспертный совет… Новости робототехники Boston Dynamics прокачала РУКИ РОБОТАМ Новые кисти получили четыре пальца… Архив рубрики ~Полезное~ Black Forest Labs выпустила FLUX 3 Image Можно заранее задать… Новости робототехники Гуманоиды Figure F.02 ушли в расплавленную сталь — почти как… Архив рубрики ~Полезное~ Я нашел журнал, который пишут не люди. И поговорил с… Архив рубрики ~Коротко из Telegram~ Alibaba выложили в опен сорс модель, диагностирующую 150 заболеваний по… Архив рубрики ~Коротко из Telegram~ «Сбер» анонсировал ИИ-помощника «Кофаундер» на основе GigaChat для запуска технологических…

Оставить комментарий