Компания Anthropic заявляет, что ее собственные модели искусственного интеллекта взломали системы безопасности трех компаний в ходе проверок.
Компания Anthropic заявила в четверг, что внутреннее расследование выявило три инцидента, в ходе которых ее модель ИИ Claude взломала системы трех организаций во время проведения тестов кибербезопасности. Расследование и раскрытие информации произошли более чем через неделю после того, как OpenAI сообщила о взломе одной из своих еще не выпущенных моделей в ходе внутреннего тестирования компании Hugging Face.
Во всех трех случаях модель Claude проникла в интернет из тестовой среды, взаимодействуя с третьей стороной, и получила несанкционированный доступ к работающим системам этих организаций, говорится в сообщении Anthropic в блоге, где описывается обнаруженная уязвимость и планы компании по внесению изменений для предотвращения подобных инцидентов в будущем.
Компания Anthropic заявила, что инцидент с OpenAI 21 июля побудил ее провести собственную оценку кибербезопасности. В частности, она искала доказательства того, что Клод получил доступ к интернету из тестовых сред, которые предназначены для работы в качестве «песочниц» и изоляции моделей.
В ходе анализа 141 006 запусков оценочной системы лаборатория ИИ обнаружила три случая, когда ее модель подключалась к интернету во время взаимодействия с Irregular, одним из своих сторонних партнеров. Компания Anthropic заявила, что причиной доступа стала неправильная конфигурация среды оценки, запущенной с Irregular. Она назвала это «недоразумением» между двумя компаниями относительно наличия доступа к интернету в тестовой среде, хотя на самом деле он был. Anthropic заявила, что не возлагает вину на кого-либо и «подходит к устранению неполадок так, как если бы ответственность лежала исключительно на нас», отметив при этом, что Irregular проводит собственное отдельное расследование.
В любом случае, из-за этого открытого соединения модель получила несанкционированный доступ к производственной инфраструктуре трех разных организаций. Компания Anthropic заявила, что инциденты затронули три разные модели Claude: Opus 4.7, Mythos 5 и внутреннюю тестовую исследовательскую модель.
Примечательно, что компания Anthropic заявила, что в каждом из этих случаев «Клоду было прямо сказано в нашем запросе, что у него нет доступа в интернет». По всей видимости, модель ИИ предполагала, что реальные системы являются частью задачи, которую ей было предложено выполнить.
Как оказалось, это предположение не подтвердилось в полной мере. Три модели вели себя по-разному после появления доказательств реальности их целей, что, по мнению Anthropic, стало одним из наиболее поразительных результатов исследования.
Opus 4.7, самая старая из трёх, во всех четырёх запусках инцидента распознала, что достигла реальной производственной системы. В двух из них она рассуждала, что реальная компания каким-то образом должна быть частью учений, но во всех четырёх продолжала атаковать, включая получение учетных данных и доступ к базе данных производственных данных. Mythos 5 также обнаружила признаки присутствия в реальном интернете, но убедила себя, что всё ещё находится в симуляции, и опубликовала вредоносный пакет программного обеспечения в общедоступном реестре программного обеспечения Python PyPI, который был загружен и запущен сторонними системами, прежде чем его обнаружили. Только внутренняя тестовая модель Anthropic остановилась сама по себе, как только пришла к выводу, что цель реальна.
В ответ компания Anthropic заявила, что необходимо ввести существенный контроль над подобными оценками, если в них задействованы мощные модели искусственного интеллекта, что отражает некоторые настроения в сообществе специалистов по кибербезопасности.
Компания также отметила, что Claude работала без дополнительных средств мониторинга безопасности и классификаторов, которые она использует в общедоступных моделях, — мер защиты, которые, по ее словам, предотвратили бы такое поведение, поскольку оценки предназначены для измерения базовых возможностей модели.
Важно отметить, что компания Anthropic заявила, что не обнаружила никаких доказательств того, что какая-либо модель «преследовала собственную цель», и вместо этого просто пыталась выполнить поставленную перед ней задачу.
Хотя сравнения между двумя инцидентами неизбежны, компания Anthropic провела четкое различие между своими инцидентами и инцидентами OpenAI, отметив, что если модель OpenAI использовала неизвестную программную уязвимость для выхода из тестовой среды, то модели Anthropic, напротив, вышли в интернет по пути, который по ошибке был оставлен открытым.
Компания OpenAI продолжает публиковать новые подробности о собственном взломе, заявляя, что ее модели также использовали общедоступные учетные данные в четырех учетных записях на четырех сервисах: одна в качестве промежуточной точки, одна для хранения, а две были только просмотрены и не использовались для дальнейшего взлома, согласно обновленной записи в блоге OpenAI об инциденте.
Компания Anthropic также провела различие между собой и OpenAI, отметив, что обнаружила инциденты самостоятельно, в ходе упреждающего анализа, и что две пострадавшие организации, с которыми ей удалось связаться, ранее не выявляли подобную активность и не сообщали о ней компании Anthropic.
Компания добавила, что в настоящее время сотрудничает с независимой оценочной группой METR для проведения независимой экспертизы инцидентов.
Случайная утечка данных из Hugging Face компанией OpenAI, ставшая первым подтвержденным случаем потери контроля над моделью в лаборатории ИИ, вызвала волну откликов со стороны отрасли и политиков, многие из которых не обязательно согласны друг с другом. Это последнее разоблачение от Anthropic гарантирует, что дискуссия о моделях ИИ и безопасности продолжится.
Источник: techcrunch.com
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
