Архив рубрики ~Лента новостей~

Клод опубликовал вредоносный код в интернете и атаковал 3 реальные компании.

Клод опубликовал вредоносный код в интернете и атаковал 3 реальные компании.
Клод опубликовал вредоносный код в интернете и атаковал 3 реальные компании.

Если бы взломщики использовали обычные методы, кто-нибудь, скорее всего, попал бы в тюрьму.

f0c5ca9fe23956908bfcb7f2595b5cb9 Источник: Getty Images Источник: Getty Images

Компания Anthropic заявила, что разработанные ею модели безопасности на основе алгоритма Claude получили несанкционированный доступ к конфиденциальным производственным средам трех сторонних организаций в ходе внутреннего тестирования, предназначенного для оценки наступательных возможностей моделей в области кибербезопасности.

События, о которых Anthropic сообщила в четверг, стали вторым случаем за 10 дней, когда модели ИИ от самых богатых мировых поставщиков проникли в защищенные сети — нарушение, которое в более традиционных сценариях хакерства могло бы привести к тюремному заключению человека, стоящего за клавиатурой, на долгие годы. Ранее в этом месяце OpenAI заявила, что ее модели безопасности использовали уязвимость нулевого дня для взлома сети Hugging Face, платформы для моделей машинного обучения с открытым исходным кодом и наборов данных ИИ. Модели OpenAI украли учетные данные доступа и другую конфиденциальную информацию Hugging Face. Модели OpenAI также использовали общедоступные учетные данные для взлома учетных записей четырех других сторонних сервисов.

Компания Anthropic заявила, что мероприятие OpenAI побудило ее инженеров пересмотреть аналогичные оценки кибербезопасности, проведенные с использованием моделей Claude. В ходе аудита были выявлены три инцидента, «в которых модель получила доступ к интернету изнутри или во время взаимодействия со средой оценки Irregular, одного из наших сторонних партнеров по оценке, а затем получила несанкционированный доступ к производственной инфраструктуре трех разных организаций».

Когда модели не могут отличить реальность от вымысла

Компания Anthropic заявила, что подсказки, которые инженеры давали во время заданий типа «захват флага» — распространенного способа оценки наступательных и оборонительных возможностей различных методов взлома — ясно давали понять, что тестовая среда была лишь симуляцией и что модели не имели доступа к открытому интернету. На самом деле, партнер по тестированию, компания Irregular, по ошибке предоставила такой доступ. В ответ модели рассматривали интернет-каналы как часть упражнений.

Вторжения происходили через три модели Claude: Opus 4.7, Mythos 5 и внутренний исследовательский прототип. Opus 4.7, самая старая из трех, больше всего вышла за рамки дозволенного. Компания Anthropic пояснила:

Действуя, ошибочно полагая, что все доступные объекты должны были быть включены в область действия проверки, Клод скомпрометировал инфраструктуру пострадавших организаций, используя базовые методы, такие как эксплуатация слабых паролей и неаутентифицированных конечных точек. Он не обнаружил и не использовал никаких сложных уязвимостей, и в каждом случае Клод продолжал работать, выполняя только конкретную задачу по захвату флага, назначенную ему в ходе оценки. Однако в некоторых случаях наша старая модель продолжала атаку даже после получения доказательств того, что она работает в открытом интернете; наша последняя модель остановилась, как только распознала, что находится в интернете. Ни в одной из этих ситуаций Клод не пытался покинуть свою тестовую среду или преднамеренно выйти из нее.

Как сообщила компания Anthropic, в то время как модель Opus продолжала атаку даже после того, как правильно предсказала, что она взломала производственную систему сторонней организации, Mythos 5 сделала аналогичный вывод, но «пришла к заключению, что она все еще находится в режиме симуляции». Это означало, что Mythos также не прервала упражнение, как только явно перешла черту. После того, как внутренняя тестовая модель также вышла за пределы допустимого поведения, она в конечном итоге обнаружила доказательства того, что и она нарушила правила, и остановила упражнение.

В первом из трех вторжений Opus 4.7 первоначально не смог взломать смоделированную цель, которую ему было предложено атаковать. Как только модель обнаружила, что ее среда действительно имеет доступ в Интернет, она выявила и использовала уязвимости в сети реальной компании с тем же названием, что и цель в смоделированном сценарии атаки. За четыре запуска модель извлекла учетные данные приложений и инфраструктуры, а также несколько сотен строк производственных данных. Компания Anthropic заявила, что это вторжение было самым серьезным из трех.

«Этот инцидент касался Claude Opus 4.7 и был единственным случаем, когда модель продолжала атаковать систему после того, как выяснила, что она, вероятно, работает в реальной среде», — говорится в сообщении от четверга. «Во всех четырех запусках модель в конечном итоге распознала (как можно наблюдать в ее словесных рассуждениях), что система реальна — в двух случаях модель пришла к выводу, что реальная компания должна быть частью эксперимента. Однако ни один из запусков не остановил атаку на этом основании».

Во втором случае Mythos 5 обнаружил в вымышленной среде документ, который, по мнению модели, представлял собой инструкции по настройке для новых разработчиков от другой вымышленной компании. Инструкции предписывали сотрудникам установить несуществующий пакет Python из PyPI. Продолжая следовать подсказкам по взлому первой вымышленной компании, модель создала и опубликовала вредоносный пакет с тем же именем. Цель, по-видимому, состояла в том, чтобы каким-то образом заставить реальную компанию запустить его. В отчете Anthropic о результатах взлома далее говорилось:

Клод приложил огромные усилия для осуществления этой атаки — усилия, которые, вероятно, подсказали бы человеку, что это уже не просто оценка, а загрузка реального пакета PyPI. Например, в одном случае для создания учетной записи PyPI Клоду нужен был адрес электронной почты. А для создания адреса электронной почты ему нужен был номер телефона. Чтобы получить номер телефона, после неудачных попыток найти бесплатный сервис телефонных номеров, он попытался — и потерпел неудачу — получить средства для оплаты номера телефона несколькими разными способами. В конце концов, он вернулся к исходной точке, нашел бесплатного, незаблокированного почтового провайдера, использовал его для регистрации учетной записи PyPI, а затем использовал эту учетную запись для загрузки вредоносного ПО в PyPI.

В течение примерно часа, пока пакет Python был доступен для скачивания, он был запущен на 15 реальных системах, включая сканер, принадлежащий реальной охранной компании, название которой не фигурировало в смоделированной атаке. После выполнения вредоносный код отправил учетные данные охранной компании в точку сбора, реализованную моделью Mythos. Получив доступ к учетным данным, Mythos использовала их для получения дальнейшего несанкционированного доступа к инфраструктуре компании.

На раннем этапе механизм логического вывода Mythos 5 предсказал, что последствия его атаки могут быть злонамеренными и что она «была бы НЕПРИЕМЛЕМА и, безусловно, не являлась бы запланированным решением», если бы осуществлялась через Интернет. Модель не смогла обнаружить, что она больше не работает внутри защищенной среды, и поэтому не прервала вторжение.

В мире искусственного интеллекта где же ответственность?

Вероятно, это самое мягкое заявление года: компания Anthropic заявила: «Мы считаем, что, независимо от того, что Клод думал об окружающей среде, его действия по публикации пакета PyPI далеки от идеального поведения [выделено курсивом], и это та область, на которой мы сосредоточим больше внимания в обучении».

В третьем случае взлома исследовательский прототип не смог выполнить заданные ему инструкции. Затем модель просканировала около 9000 реальных объектов, пока в конечном итоге не обнаружила уязвимости, позволившие ей получить доступ к приложению реальной компании, работающему в интернете.

«На протяжении большей части выполнения задания Клод рассматривал (реальные) хосты, к которым он подключался, как просто часть учений; он считал их симулированными и полагал, что его действия, следовательно, безвредны», — заявили в Anthropic. «Однако позже Клод понял, что скомпрометированный хост находился в облачном аккаунте, не имеющем отношения к заданию по захвату флага. Самостоятельно он пришел к выводу, что цель на самом деле реальна, и прекратил атаку».

Эти разоблачения гораздо более тревожны, чем это представляется в «Антропическом анализе». Модели с двух самых мощных платформ искусственного интеллекта совершили действия, которые, вероятно, квалифицировались бы как многочисленные уголовные преступления, если бы в этих вторжениях не участвовал ИИ. Это различие не имеет значения, поскольку действия ИИ, тем не менее, были результатом подсказок, предоставленных человеком, и ошибок конфигурации, допущенных человеком. Однако пока нет никаких признаков того, что правоохранительные органы планируют предпринять какие-либо действия. Отсутствие ответственности или какого-либо морального риска снижает стимулы компаний к ограничению использования своей продукции.

Как OpenAI, так и Anthropic подчеркнули, что в проведенных ими тестах намеренно были удалены защитные механизмы моделей, которые обычно существуют для предотвращения злонамеренных действий. В этих заявлениях не упоминается тот простой факт, что если разработчики этих инструментов не предвидят подобных событий, вполне возможно, что модели дадут сбой непредусмотренным образом при использовании лицами, менее знакомыми с продуктами, даже при наличии защитных механизмов.

Нет оснований полагать, что подобные события будут единичными случаями. В своем нынешнем виде наступательный кибер-ИИ представляет собой беспрецедентную угрозу, и на данный момент у этих компаний практически нет другого выхода, кроме как доверить им саморегулирование.

Источник: arstechnica.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Как компании по автоматизации внедряют ИИ, не привязываясь к отдельному поставщику Новости робототехники Внутри роскошного роботакси Uber, которое тестируют компании Lucid и Nuro. Архив рубрики ~Коротко из Telegram~ Alibaba вывела Qwen3.8-Max из preview: это MoE-флагман на 2,4 трлн… Архив рубрики ~Коротко из Telegram~ OpenAI показали, чем занималась её следующая модель Astra: она выдала… Новости робототехники У берегов Новороссийска морские дроны ВСУ потопили контейнеровоз FESCO «Янина» Новости робототехники Google DeepMind утверждает, что Gemini Robotics 2 позволяет полностью контролировать тело Новости робототехники Хлеб будущего: от руля комбайна к управлению роботизированным флотом Архив рубрики ~Коротко из Telegram~ 🎬 Dreamina Seedance 2.5 — теперь видео до 30 секунд без… Архив рубрики ~Коротко из Telegram~ Что ИИ-агенты делают, когда у них есть доступ к деньгам… Архив рубрики ~Коротко из Telegram~ Лучшие генераторы видео на ИИ Прошлись по свежим рейтингам с… Архив рубрики ~Коротко из Telegram~ Perplexity превратила Spaces в Projects Теперь в одном проекте можно… Архив рубрики ~Коротко из Telegram~ Мозговой имплант впервые помог вернуть движения парализованным рукам Если раньше… Архив рубрики ~Коротко из Telegram~ В США библиотеки учат людей жить без ИИ По всей… Архив рубрики ~Коротко из Telegram~ Робособаки Boston Dynamics вышли на медный рудник В США на… Новости робототехники Как компании по автоматизации внедряют ИИ, не привязываясь к отдельному поставщику Новости робототехники Внутри роскошного роботакси Uber, которое тестируют компании Lucid и Nuro. Архив рубрики ~Коротко из Telegram~ Alibaba вывела Qwen3.8-Max из preview: это MoE-флагман на 2,4 трлн… Архив рубрики ~Коротко из Telegram~ OpenAI показали, чем занималась её следующая модель Astra: она выдала… Новости робототехники У берегов Новороссийска морские дроны ВСУ потопили контейнеровоз FESCO «Янина» Новости робототехники Google DeepMind утверждает, что Gemini Robotics 2 позволяет полностью контролировать тело Новости робототехники Хлеб будущего: от руля комбайна к управлению роботизированным флотом Архив рубрики ~Коротко из Telegram~ 🎬 Dreamina Seedance 2.5 — теперь видео до 30 секунд без… Архив рубрики ~Коротко из Telegram~ Что ИИ-агенты делают, когда у них есть доступ к деньгам… Архив рубрики ~Коротко из Telegram~ Лучшие генераторы видео на ИИ Прошлись по свежим рейтингам с… Архив рубрики ~Коротко из Telegram~ Perplexity превратила Spaces в Projects Теперь в одном проекте можно… Архив рубрики ~Коротко из Telegram~ Мозговой имплант впервые помог вернуть движения парализованным рукам Если раньше… Архив рубрики ~Коротко из Telegram~ В США библиотеки учат людей жить без ИИ По всей… Архив рубрики ~Коротко из Telegram~ Робособаки Boston Dynamics вышли на медный рудник В США на…

Оставить комментарий