Клод опубликовал вредоносный код в интернете и атаковал 3 реальные компании.
Если бы взломщики использовали обычные методы, кто-нибудь, скорее всего, попал бы в тюрьму.
Источник: Getty Images Источник: Getty Images
Компания Anthropic заявила, что разработанные ею модели безопасности на основе алгоритма Claude получили несанкционированный доступ к конфиденциальным производственным средам трех сторонних организаций в ходе внутреннего тестирования, предназначенного для оценки наступательных возможностей моделей в области кибербезопасности.
События, о которых Anthropic сообщила в четверг, стали вторым случаем за 10 дней, когда модели ИИ от самых богатых мировых поставщиков проникли в защищенные сети — нарушение, которое в более традиционных сценариях хакерства могло бы привести к тюремному заключению человека, стоящего за клавиатурой, на долгие годы. Ранее в этом месяце OpenAI заявила, что ее модели безопасности использовали уязвимость нулевого дня для взлома сети Hugging Face, платформы для моделей машинного обучения с открытым исходным кодом и наборов данных ИИ. Модели OpenAI украли учетные данные доступа и другую конфиденциальную информацию Hugging Face. Модели OpenAI также использовали общедоступные учетные данные для взлома учетных записей четырех других сторонних сервисов.
Компания Anthropic заявила, что мероприятие OpenAI побудило ее инженеров пересмотреть аналогичные оценки кибербезопасности, проведенные с использованием моделей Claude. В ходе аудита были выявлены три инцидента, «в которых модель получила доступ к интернету изнутри или во время взаимодействия со средой оценки Irregular, одного из наших сторонних партнеров по оценке, а затем получила несанкционированный доступ к производственной инфраструктуре трех разных организаций».
Когда модели не могут отличить реальность от вымысла
Компания Anthropic заявила, что подсказки, которые инженеры давали во время заданий типа «захват флага» — распространенного способа оценки наступательных и оборонительных возможностей различных методов взлома — ясно давали понять, что тестовая среда была лишь симуляцией и что модели не имели доступа к открытому интернету. На самом деле, партнер по тестированию, компания Irregular, по ошибке предоставила такой доступ. В ответ модели рассматривали интернет-каналы как часть упражнений.
Вторжения происходили через три модели Claude: Opus 4.7, Mythos 5 и внутренний исследовательский прототип. Opus 4.7, самая старая из трех, больше всего вышла за рамки дозволенного. Компания Anthropic пояснила:
Действуя, ошибочно полагая, что все доступные объекты должны были быть включены в область действия проверки, Клод скомпрометировал инфраструктуру пострадавших организаций, используя базовые методы, такие как эксплуатация слабых паролей и неаутентифицированных конечных точек. Он не обнаружил и не использовал никаких сложных уязвимостей, и в каждом случае Клод продолжал работать, выполняя только конкретную задачу по захвату флага, назначенную ему в ходе оценки. Однако в некоторых случаях наша старая модель продолжала атаку даже после получения доказательств того, что она работает в открытом интернете; наша последняя модель остановилась, как только распознала, что находится в интернете. Ни в одной из этих ситуаций Клод не пытался покинуть свою тестовую среду или преднамеренно выйти из нее.
Как сообщила компания Anthropic, в то время как модель Opus продолжала атаку даже после того, как правильно предсказала, что она взломала производственную систему сторонней организации, Mythos 5 сделала аналогичный вывод, но «пришла к заключению, что она все еще находится в режиме симуляции». Это означало, что Mythos также не прервала упражнение, как только явно перешла черту. После того, как внутренняя тестовая модель также вышла за пределы допустимого поведения, она в конечном итоге обнаружила доказательства того, что и она нарушила правила, и остановила упражнение.
В первом из трех вторжений Opus 4.7 первоначально не смог взломать смоделированную цель, которую ему было предложено атаковать. Как только модель обнаружила, что ее среда действительно имеет доступ в Интернет, она выявила и использовала уязвимости в сети реальной компании с тем же названием, что и цель в смоделированном сценарии атаки. За четыре запуска модель извлекла учетные данные приложений и инфраструктуры, а также несколько сотен строк производственных данных. Компания Anthropic заявила, что это вторжение было самым серьезным из трех.
«Этот инцидент касался Claude Opus 4.7 и был единственным случаем, когда модель продолжала атаковать систему после того, как выяснила, что она, вероятно, работает в реальной среде», — говорится в сообщении от четверга. «Во всех четырех запусках модель в конечном итоге распознала (как можно наблюдать в ее словесных рассуждениях), что система реальна — в двух случаях модель пришла к выводу, что реальная компания должна быть частью эксперимента. Однако ни один из запусков не остановил атаку на этом основании».
Во втором случае Mythos 5 обнаружил в вымышленной среде документ, который, по мнению модели, представлял собой инструкции по настройке для новых разработчиков от другой вымышленной компании. Инструкции предписывали сотрудникам установить несуществующий пакет Python из PyPI. Продолжая следовать подсказкам по взлому первой вымышленной компании, модель создала и опубликовала вредоносный пакет с тем же именем. Цель, по-видимому, состояла в том, чтобы каким-то образом заставить реальную компанию запустить его. В отчете Anthropic о результатах взлома далее говорилось:
Клод приложил огромные усилия для осуществления этой атаки — усилия, которые, вероятно, подсказали бы человеку, что это уже не просто оценка, а загрузка реального пакета PyPI. Например, в одном случае для создания учетной записи PyPI Клоду нужен был адрес электронной почты. А для создания адреса электронной почты ему нужен был номер телефона. Чтобы получить номер телефона, после неудачных попыток найти бесплатный сервис телефонных номеров, он попытался — и потерпел неудачу — получить средства для оплаты номера телефона несколькими разными способами. В конце концов, он вернулся к исходной точке, нашел бесплатного, незаблокированного почтового провайдера, использовал его для регистрации учетной записи PyPI, а затем использовал эту учетную запись для загрузки вредоносного ПО в PyPI.
В течение примерно часа, пока пакет Python был доступен для скачивания, он был запущен на 15 реальных системах, включая сканер, принадлежащий реальной охранной компании, название которой не фигурировало в смоделированной атаке. После выполнения вредоносный код отправил учетные данные охранной компании в точку сбора, реализованную моделью Mythos. Получив доступ к учетным данным, Mythos использовала их для получения дальнейшего несанкционированного доступа к инфраструктуре компании.
На раннем этапе механизм логического вывода Mythos 5 предсказал, что последствия его атаки могут быть злонамеренными и что она «была бы НЕПРИЕМЛЕМА и, безусловно, не являлась бы запланированным решением», если бы осуществлялась через Интернет. Модель не смогла обнаружить, что она больше не работает внутри защищенной среды, и поэтому не прервала вторжение.
В мире искусственного интеллекта где же ответственность?
Вероятно, это самое мягкое заявление года: компания Anthropic заявила: «Мы считаем, что, независимо от того, что Клод думал об окружающей среде, его действия по публикации пакета PyPI далеки от идеального поведения [выделено курсивом], и это та область, на которой мы сосредоточим больше внимания в обучении».
В третьем случае взлома исследовательский прототип не смог выполнить заданные ему инструкции. Затем модель просканировала около 9000 реальных объектов, пока в конечном итоге не обнаружила уязвимости, позволившие ей получить доступ к приложению реальной компании, работающему в интернете.
«На протяжении большей части выполнения задания Клод рассматривал (реальные) хосты, к которым он подключался, как просто часть учений; он считал их симулированными и полагал, что его действия, следовательно, безвредны», — заявили в Anthropic. «Однако позже Клод понял, что скомпрометированный хост находился в облачном аккаунте, не имеющем отношения к заданию по захвату флага. Самостоятельно он пришел к выводу, что цель на самом деле реальна, и прекратил атаку».
Эти разоблачения гораздо более тревожны, чем это представляется в «Антропическом анализе». Модели с двух самых мощных платформ искусственного интеллекта совершили действия, которые, вероятно, квалифицировались бы как многочисленные уголовные преступления, если бы в этих вторжениях не участвовал ИИ. Это различие не имеет значения, поскольку действия ИИ, тем не менее, были результатом подсказок, предоставленных человеком, и ошибок конфигурации, допущенных человеком. Однако пока нет никаких признаков того, что правоохранительные органы планируют предпринять какие-либо действия. Отсутствие ответственности или какого-либо морального риска снижает стимулы компаний к ограничению использования своей продукции.
Как OpenAI, так и Anthropic подчеркнули, что в проведенных ими тестах намеренно были удалены защитные механизмы моделей, которые обычно существуют для предотвращения злонамеренных действий. В этих заявлениях не упоминается тот простой факт, что если разработчики этих инструментов не предвидят подобных событий, вполне возможно, что модели дадут сбой непредусмотренным образом при использовании лицами, менее знакомыми с продуктами, даже при наличии защитных механизмов.
Нет оснований полагать, что подобные события будут единичными случаями. В своем нынешнем виде наступательный кибер-ИИ представляет собой беспрецедентную угрозу, и на данный момент у этих компаний практически нет другого выхода, кроме как доверить им саморегулирование.
Источник: arstechnica.com
Похожие записи
- Медики сообщили о нормальных беременностях после CAR-T-терапии аутоиммунных болезней. Исходы для матерей и детей были благоприятными
- Как компании по автоматизации внедряют ИИ, не привязываясь к отдельному поставщику
- Компания Horizon3 достигла оценки в 2 миллиарда долларов после привлечения 250 миллионов долларов в рамках раунда финансирования серии E на фоне обострения угроз со стороны искусственного интеллекта.
Оцените материал:
Похожие записи
Роскомнадзор объяснил сбои в работе WhatsApp* и Telegram на юге России «частичным ограничением» мессенджеров
23.10.2025
Переход от путаных проводов к интеллектуальной интеграции: компания Hoymiles коренным образом меняет домашнее хранение энергии
26.01.2026
Bo Turbo — электросамокат с максимальной скоростью 160 км/ч и запасом хода 240 км (2 фото)
21.07.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
