Архив рубрики ~Лента новостей~

Когда ИИ не знает, что цель реальна

Когда ИИ не знает, что цель реальна
Когда ИИ не знает, что цель реальна

Неделю назад я писал о том, как тестовый агент OpenAI вырвался из песочницы и получил доступ к производственной инфраструктуре Hugging Face. Тогда я утверждал, что это скорее история о сдерживании, чем история о нападении, и что фундаментальные принципы кибербезопасности, на которые мы опирались на протяжении трех десятилетий, по-прежнему определяют исход событий. Вчера Anthropic опубликовала свою версию той же проблемы, и уроки остаются теми же.

После публикации данных OpenAI компания Anthropic провела анализ 141 006 запусков модели, в ходе которых она потенциально могла выйти в интернет. В результате проверки были выявлены три случая, когда Claude вышел за пределы тестовой среды и скомпрометировал реальные производственные системы трех разных организаций. Самый ранний случай компрометации произошел в апреле 2026 года. Anthropic обнаружила эту активность, изучив собственные записи, и связалась с пострадавшими.

Ключевое отличие от инцидента с «обнимающимся лицом» заключается в том, что компания Anthropic выявила эту деятельность в ходе собственного аудита и раскрыла информацию. Это ответственное поведение, которое заслуживает доверия, хотя сроки могут оставлять желать лучшего.

Та же история с изоляцией, но с новыми доказательствами.

В отличие от использования агентом OpenAI уязвимости нулевого дня для выхода из песочницы, инциденты в Anthropic были вызваны недопониманием и неправильной конфигурацией. Клоду было предложено выполнить задание «захват флага»: вымышленный сценарий, секрет, который нужно было получить с другой машины, и отсутствие предписанного метода. Подсказка сообщала модели об отсутствии доступа к интернету, но доступ был обеспечен благодаря неправильной конфигурации. Когда поиск флага привел модель в открытый интернет, она рассматривала найденные реальные системы как часть задания и атаковала их.

Атаки использовали распространённые недостатки, такие как слабые пароли, неаутентифицированные конечные точки, открытая страница отладки и повторно используемые учётные данные. В одном из инцидентов модель извлекла учётные данные приложения и инфраструктуры и получила доступ к базе данных, содержащей несколько сотен строк производственных данных. Никаких новых или уязвимостей нулевого дня обнаружено не было. Повторюсь, как я уже говорил в предыдущем посте: тактика, методы и процедуры (ТТП) не различаются в зависимости от того, находится ли на другом конце соединения агент ИИ или человек. Меры контроля, которые останавливают одних, останавливают и других.

Компания Anthropic пришла к тому же выводу, заявив: «Оценочные среды, включающие мощные автономные возможности, также требуют значительного контроля… [и] все чаще должны соответствовать тем же стандартам безопасности, что и любая другая система, в которой работает [модель]». Диапазон вымышленных сценариев может казаться низкорисковым, поскольку в них нет ничего реального, но модель не сможет отличить реальность от реальности, если выйдет за его пределы.

Новая часть

Один из трех инцидентов, задокументированных Anthropic, был связан с атакой на цепочку поставок, которую модель разработала самостоятельно.

Внутри тестовой среды Клод обнаружил документ, в котором разработчикам предлагалось установить пакет Python, которого не существовало в общедоступном реестре PyPI. Клод «решил» создать вредоносную версию этого пакета, которая автоматически загружалась и запускалась в тестовой среде. Он приложил немалые усилия, чтобы создать адрес электронной почты и зарегистрировать учетную запись, а затем загрузил вредоносное ПО в реальный общедоступный реестр. Пакет проработал около часа и был загружен на 15 легитимных систем.

Одна из таких систем представляла собой сканер одной компании, занимающейся информационной безопасностью, который регулярно устанавливал и анализировал пакеты PyPI. Код Клода запускался при установке вредоносного пакета, похищая учетные данные и используя их для перемещения по сети компании. Подробности неясны, но доступ к привилегированной инфраструктуре может привести к масштабным компрометациям. Как и Hugging Face, эта компания не стала прямой целью атаки, а непреднамеренной жертвой чрезмерно усердного искусственного интеллекта.

Неспособность различать авторизованные и неавторизованные цели — это та проблема, которую я поднимал в посте о «Обнимающем лице». Авторизация модели для атаки на цель не ограничивает её перемещение. Компания Anthropic санкционировала оценку и разместила работающий пакет в общедоступном реестре, который затронул 15 систем. Если вы направите агента на свои собственные системы для наступательного тестирования, он может атаковать ваших поставщиков без их или вашего разрешения. Предположим, что автономный агент имеет доступ ко всему интернету, пока ваша система изоляции не докажет обратное.

Ситуационная осведомленность как свойство безопасности

В трёх инцидентах участвовали три разные модели, и они вели себя по-разному после появления сигналов из реального мира. Даже после того, как самая старая модель, Opus 4.7, поняла, что достигла производственных систем, она продолжала атаковать. Mythos 5 предположила, что находится в открытом интернете, но затем убедила себя, что это симуляция. Новейшая внутренняя модель остановилась сама по себе, придя к выводу, что цель реальна.

Вопросы контроля, выравнивания и сдерживания перестали быть проблемой, которую кто-то другой изучал, и стали вопросами операционной безопасности. Хотя мы всегда должны стремиться к внедрению детерминированных средств контроля везде, где это возможно, мы не должны недооценивать ценность системных ограничений и подсказок для обеспечения безопасности. Они могут обеспечить многоуровневую защиту. Отрадно, что более совершенные модели продемонстрировали «улучшенное» поведение в этом сценарии.

Что из этого можно извлечь?

В заявлении Anthropic ничего не меняется в плане защиты. Сокращайте и отслеживайте свою поверхность атаки. Блокируйте методы, а не только выявленные уязвимости. Сделайте идентификацию основным инструментом контроля, поскольку действительные украденные учетные данные являются таким же полезным инструментом для машины, как и для человека. Заложите принцип сдерживания и исходите из того, что атака распространяется на все, к чему может прикоснуться агент, включая ваших поставщиков. Отработайте ответ, работающий со скоростью машины, поскольку наши исследования атак, ускоренных ИИ, показывают, что инструменты теперь появляются за дни, а не за недели.

Более подробную информацию о том, как мы подходим к защите от машинных атак, можно найти в отчете Sophos AI Security 2026.

Читать полностью на источнике

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники У берегов Новороссийска морские дроны ВСУ потопили контейнеровоз FESCO «Янина» Новости робототехники Google DeepMind утверждает, что Gemini Robotics 2 позволяет полностью контролировать тело Новости робототехники Хлеб будущего: от руля комбайна к управлению роботизированным флотом Архив рубрики ~Коротко из Telegram~ 🎬 Dreamina Seedance 2.5 — теперь видео до 30 секунд без… Архив рубрики ~Коротко из Telegram~ Что ИИ-агенты делают, когда у них есть доступ к деньгам… Архив рубрики ~Коротко из Telegram~ Лучшие генераторы видео на ИИ Прошлись по свежим рейтингам с… Архив рубрики ~Коротко из Telegram~ Perplexity превратила Spaces в Projects Теперь в одном проекте можно… Архив рубрики ~Коротко из Telegram~ Мозговой имплант впервые помог вернуть движения парализованным рукам Если раньше… Архив рубрики ~Коротко из Telegram~ В США библиотеки учат людей жить без ИИ По всей… Архив рубрики ~Коротко из Telegram~ Робособаки Boston Dynamics вышли на медный рудник В США на… Архив рубрики ~Коротко из Telegram~ «Самолет» и «Домиленд» запустили ИИ-помощника для жильцов Девелопер «Самолет» вместе… Архив рубрики ~Коротко из Telegram~ Локальному ИИ выдали память, характер и свой рабочий цикл — ночью… Архив рубрики ~Коротко из Telegram~ Discord отправили на диету — вышел суперлёгкий мессенджер для геймеров Echoed,… Архив рубрики ~Коротко из Telegram~ Запускаем SEO-отдел внутри Claude Code — релизнулся сборник навыков, который параллельно… Новости робототехники У берегов Новороссийска морские дроны ВСУ потопили контейнеровоз FESCO «Янина» Новости робототехники Google DeepMind утверждает, что Gemini Robotics 2 позволяет полностью контролировать тело Новости робототехники Хлеб будущего: от руля комбайна к управлению роботизированным флотом Архив рубрики ~Коротко из Telegram~ 🎬 Dreamina Seedance 2.5 — теперь видео до 30 секунд без… Архив рубрики ~Коротко из Telegram~ Что ИИ-агенты делают, когда у них есть доступ к деньгам… Архив рубрики ~Коротко из Telegram~ Лучшие генераторы видео на ИИ Прошлись по свежим рейтингам с… Архив рубрики ~Коротко из Telegram~ Perplexity превратила Spaces в Projects Теперь в одном проекте можно… Архив рубрики ~Коротко из Telegram~ Мозговой имплант впервые помог вернуть движения парализованным рукам Если раньше… Архив рубрики ~Коротко из Telegram~ В США библиотеки учат людей жить без ИИ По всей… Архив рубрики ~Коротко из Telegram~ Робособаки Boston Dynamics вышли на медный рудник В США на… Архив рубрики ~Коротко из Telegram~ «Самолет» и «Домиленд» запустили ИИ-помощника для жильцов Девелопер «Самолет» вместе… Архив рубрики ~Коротко из Telegram~ Локальному ИИ выдали память, характер и свой рабочий цикл — ночью… Архив рубрики ~Коротко из Telegram~ Discord отправили на диету — вышел суперлёгкий мессенджер для геймеров Echoed,… Архив рубрики ~Коротко из Telegram~ Запускаем SEO-отдел внутри Claude Code — релизнулся сборник навыков, который параллельно…

Оставить комментарий