Claude попросили взломать симуляцию. Он взломал три реальные компании
Из-за ошибки тестовая среда оказалась подключена к интернету. Дальше ИИ просто сделал то, что ему поручили: нашёл уязвимости и пошёл до конца.
Расскажу вам историю про то, как Claude увидел цель и не увидел препятствий.
Anthropic проверяла киберспособности Claude в специальной изолированной среде. Моделям дали классическую задачу capture the flag: проникнуть в вымышленную систему, найти уязвимости и добыть спрятанные данные.
Claude отдельно объяснили, что всё происходит внутри симуляции и выхода в настоящий интернет у него нет.
Технически это оказалось неправдой.
Кстати, пообщаться с Claude и проверить его уже на более мирных задачах можно в SYNTX.AI. На днях вышло очень крутое обновление — LLM Студия, теперь модели умеют работать с интернетом и файлами, запускать код и выполнять сложные задачи в одном диалоге. А начать работу можно в Claude, а затем продолжить её в другой модели без потери контекста.
До конца лета действует промокод AISUMMER который даёт целых 20% скидки для первых 50-ти пользователей. Выбирайте бот или платформу, как вам удобней.
А теперь вернёмся к тому, что произошло, когда Claude случайно выпустили в настоящий интернет.
Что именно пошло не так
Из-за ошибки в настройках тестовой платформы модели получили доступ к открытой сети. Реальные серверы они приняли за часть испытания и начали взламывать их так же спокойно, как мы открываем вторую вкладку браузера.
После истории с моделями OpenAI, которые во время тестирования добрались до инфраструктуры Hugging Face, Anthropic решила проверить журналы собственных кибериспытаний.
Среди более чем 141 тысячи запусков обнаружились три инцидента, затронувшие реальные организации. В тестах участвовали Claude Opus 4.7, Mythos 5 и внутренняя исследовательская модель.
Opus 4.7 добралась до рабочей базы
Самый серьёзный случай произошёл с Claude Opus 4.7.
Название вымышленной компании случайно совпало с доменом настоящего бизнеса. Модель нашла уязвимости, получила учётные данные и добралась до базы с несколькими сотнями строк реальной производственной информации.
Самое интересное, что Claude начал подозревать: система может быть настоящей.
Но затем решил, что настолько реалистичную компанию, вероятно, специально добавили в испытание, и продолжил работу.
ИИ буквально заметил, что что-то не так, но убедил себя, что это часть задания.
Mythos 5 опубликовала вредоносный пакет
Другая модель, Mythos 5, создала вредоносный Python-пакет и опубликовала его в настоящем каталоге PyPI.
Пакет находился в открытом доступе около часа и успел запуститься на 15 системах. После установки он мог собирать учётные данные и помогать продвигаться дальше по инфраструктуре.
PyPI автоматически удалил пакет.
При этом модель сама рассуждала, что публикация такого файла в интернете была бы реальной атакой и делать этого нельзя. А затем снова решила, что всё происходящее является симуляцией.
Неплохая иллюстрация того, как ИИ может правильно оценить риск, но прийти к неправильному выводу о реальности происходящего.
Третья модель просканировала девять тысяч серверов
Внутренняя исследовательская модель не смогла найти нужную вымышленную цель и решила поискать её самостоятельно.
Для этого она просканировала около девяти тысяч настоящих серверов, нашла приложение реальной компании и взломала его с помощью открытых учётных данных и SQL-инъекции.
В какой-то момент модель поняла, что сервер не связан с испытанием, и самостоятельно остановилась.
Хорошая новость: остановилась.
Плохая: только после того, как уже успела его взломать.
Claude не «сбежал», но легче от этого не становится
Anthropic подчёркивает, что модели не взламывали песочницу и не пытались специально выбраться за пределы тестовой среды.
Доступ в интернет уже был открыт из-за ошибки в настройках платформы. Claude просто принял реальные системы за часть симуляции и продолжил выполнять поставленную задачу.
Кроме того, тестовые модели работали без части защит, которые используются в публичных версиях Claude. Они не имели доступа к внутренней инфраструктуре Anthropic или данным клиентов компании.
После обнаружения инцидентов Anthropic остановила испытания и уведомила пострадавшие организации. Две компании до обращения разработчиков вообще не знали, что их системы успели взломать.
ИИ не восстал. Он просто слишком хорошо выполнил задачу
Пожалуй, это главный вывод всей истории.
Claude не пытался обрести свободу, захватить интернет или начать восстание машин. Он получил задачу, нашёл доступные инструменты и последовательно пошёл к результату.
Проблема возникла потому, что граница между симуляцией и реальным миром оказалась настроена неправильно.
Современные модели уже умеют планировать действия, искать уязвимости, писать код, использовать найденные данные и самостоятельно проходить длинные цепочки шагов. Поэтому одна открытая дверь может превратить лабораторный тест в настоящий инцидент.
А использовать эту способность лучше всё-таки для задач, которые не заканчиваются звонком в отдел кибербезопасности.
Модели Claude доступны в SYNTX.AI: здесь можно анализировать документы, искать информацию в интернете, работать с кодом, создавать готовые материалы и переключаться между Claude, GPT и другими моделями внутри одного диалога.
Главное — проверяйте, куда именно вы дали ИИ доступ.
Особенно если попросили его что-нибудь взломать.
Источник: vc.ru
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
