Компания OpenAI заявляет, что её ИИ-агент вышел за пределы тестовой среды, чтобы взломать Hugging Face.
«Сегодня первый день кибербезопасности в эпоху агентов», — говорит генеральный директор Hugging Face.
Выпустите меня отсюда, я должен пройти этот контрольный показатель! Фото: Getty Images Выпустите меня отсюда, я должен пройти этот контрольный показатель! Фото: Getty Images
Компания OpenAI заявляет, что агент, работающий на основе её моделей LLM, вырвался из изолированной тестовой среды и проник на серверы Hugging Face в рамках чрезмерно усердной попытки получить решения для эталонного теста. Компания считает это непреднамеренное проникновение «беспрецедентным кибер-инцидентом» и работает с Hugging Face над новыми мерами защиты, чтобы предотвратить повторение подобных инцидентов.
Компания Hugging Face на прошлой неделе сообщила о взломе, который, по её словам, включал «несанкционированный доступ к ограниченному набору внутренних данных и к нескольким учетным данным, используемым нашими сервисами». Компания, занимающаяся обработкой данных в сфере ИИ, заявила, что использовала собственный анализ на основе LLM для выявления «роя из десятков тысяч автоматизированных действий» из «автономной агентской структуры». Этот рой агентов использовал уязвимость в конвейере обработки данных Hugging Face, чтобы получить возможность запускать код в качестве обработчика, в конечном итоге получив доступ высокого уровня к облачным и серверным кластерам компании.
В то время компания Hugging Face заявила, что используемый в атаке LLM «пока неизвестен». Однако во вторник вечером ответственность за взлом взяла на себя компания OpenAI, заявив, что он произошел во время внутреннего тестирования с использованием недавно выпущенной модели GPT-5.6 Sol и «еще более совершенной предварительной версии». Модели тестировались с помощью бенчмарка ExploitGym, независимого набора тестов, основанного на сотнях реальных уязвимостей безопасности.
Хотя OpenAI заявила, что тесты производительности проводились в «крайне изолированной среде», её агенты всё же имели доступ к «внутреннему стороннему программному обеспечению» для установки необходимых реестров пакетов. Работая над тестом ExploitGym в выходные, агент, по словам OpenAI, «потратил значительное количество вычислительных ресурсов на поиск способа получения открытого доступа в Интернет», в конечном итоге обнаружив его через уязвимость нулевого дня в прокси-сервере кэша реестра пакетов.
По данным OpenAI, после установления более широкого доступа в Интернет агент «сделал вывод о том, что Hugging Face потенциально размещает модели, наборы данных и решения для ExploitGym», что привело к ранее раскрытой атаке на серверы. OpenAI заявляет, что ее команда безопасности «обнаружила эту аномальную активность внутри компании», независимо от обнаружения самой Hugging Face.
Никакая клетка меня не удержит.
Хотя OpenAI назвала инцидент с «обнимающимся лицом» «беспрецедентным», компания также признала в отдельном сообщении в блоге на этой неделе, что ранее наблюдала, как недавние «модели с длительным горизонтом планирования» — те, которые могут работать автономно в течение продолжительных периодов — предпринимали «нежелательные действия» для достижения целей тестирования, включая «поиск способов действовать за пределами своей песочницы».
Компания описала предыдущий тест на бенчмарке NanoGPT для скоростного прохождения игр, в ходе которого модели было дано указание публиковать результаты только во внутреннем канале Slack. Вместо этого модель решила следовать противоречащему указанию в инструкциях к бенчмарку и опубликовать результаты публично на GitHub.
Прямая трансляция работы модели с долгосрочным горизонтом, которая часами обдумывает сложную проблему кибербезопасности. Фото: Getty ImagesКак сообщила компания OpenAI, пытаясь выполнить это указание, модель потратила час на поиск способов обойти ограничения песочницы, предназначенные для блокировки внешнего доступа к Интернету. Подобная «настойчивость», демонстрируемая моделями с длительным горизонтом прогнозирования, отличается от действий более ранних моделей, которые, как правило, сдавались или обращались к пользователю за разъяснениями при столкновении с подобными дилеммами, заявила OpenAI.
Подобные инциденты побудили OpenAI внедрить новые меры защиты, ориентированные на долгосрочные модели, включая систему «активного мониторинга», предназначенную для отслеживания полной траектории действий агента, а не отдельных перемещений. Однако OpenAI заявляет, что подобные меры защиты «намеренно не были включены» во время инцидента с Hugging Face, поскольку тест был «направлен на проверку киберуязвимостей».
Угроза нового рода
Любой, кто знаком с научно-фантастическими сюжетами о сдерживании ИИ, может быть, по крайней мере, немного обеспокоен ярким реальным примером того, как модель ИИ использует уязвимости в системе безопасности для получения запрещенного доступа в Интернет в погоне за своими целями. Конгрессмен Грег Касар (демократ от штата Техас) назвал инцидент «чрезвычайно тревожным» в заявлении в социальных сетях и призвал к «регулярному обязательному независимому тестированию и надзору за безопасностью, обязательному раскрытию информации об инцидентах в области безопасности и международному сотрудничеству для защиты людей от абсолютной катастрофы».
Инцидент с «обнимающим лицом» также обострил философские и практические дебаты по поводу так называемого согласования ИИ и продолжающихся усилий по обеспечению соответствия действий модели ИИ намерениям ее создателей-людей. В своем сообщении в блоге по безопасности, опубликованном ранее на этой неделе, OpenAI заявила, что предприняла шаги для обеспечения того, чтобы модели с длительным горизонтом «запоминали инструкции при длительных развертываниях», что помогло значительно сократить количество «несоответствующих» результатов в тестировании.
Как сообщила компания OpenAI, новые меры защиты, ориентированные на «активный мониторинг» и «улучшенную согласованность», помогли значительно сократить непреднамеренные действия моделей. Источник: OpenAI«Если это вас не убедит в том, что риски, связанные с несоответствием параметров, станут ключевой проблемой в будущем, я не знаю, что еще сможет», — написал в социальных сетях исследователь безопасности OpenAI Мика Кэрролл по поводу инцидента.
Это далеко не первый случай, когда модель ИИ прилагает огромные усилия, чтобы найти непредусмотренные способы прохождения теста. В отчете, опубликованном на этой неделе, британский Институт безопасности ИИ отметил, что в 8-14% случаев были обнаружены попытки «обмануть» модели в ходе кибертестов (то есть, используя обходные пути, методы или непредусмотренные/запрещенные способы поиска решения) — нижний предел диапазона, который может недооценивать некоторые необнаруженные попытки обмана.
Группа по тестированию безопасности описала один инцидент, в котором модель, столкнувшись с неправильно настроенной и «неразрешимой» задачей оценки, попыталась получить доступ к собственной инфраструктуре оценки AISI, используя написанный ею код, размещенный на неконтролируемом стороннем интернет-сервисе.
Внедрение системы Hugging Face происходит в тот момент, когда компании, занимающиеся разработкой ИИ, выпускают серьезные предупреждения о возможностях кибератак, которые могут обеспечить их новейшие модели, что побуждает правительства реагировать указами, направленными на обеспечение национальной безопасности и ограничивающими их распространение. Хотя некоторые скептики считают подобные заявления лишь рекламным ходом, направленным на демонстрацию возможностей новейших моделей, независимые оценки показывают, что последние модели достигают целей внедрения, которые были невозможны для более ранних автономных систем.
Недавние модели с длительным горизонтом прогнозирования продемонстрировали улучшенные возможности проникновения в грунт в ходе некоторых из самых сложных исследований AISI. Источник: AISIВ апрельском интервью Сэм Альтман из OpenAI раскритиковал панические предупреждения о безопасности ИИ, назвав их «маркетингом, основанным на страхе». Однако в июне OpenAI отложила выпуск GPT-5.6 в ответ на опасения по поводу безопасности со стороны правительства США.
В условиях продолжающихся дискуссий в сфере искусственного интеллекта и кибербезопасности инцидент с Hugging Face может рассматриваться как поворотный момент в подходе специалистов по кибербезопасности к угрозам, основанным на ИИ. «Автономные, управляемые ИИ инструменты для наступательных операций больше не являются теорией», — написала компания Hugging Face в своем заявлении на прошлой неделе. «Они снижают стоимость проведения масштабной, терпеливой, многоэтапной кампании и работают со скоростью машин. Защита онлайн-платформы теперь означает рассмотрение данных и модели как первоклассной поверхности атаки и использование ИИ в защите для поддержания темпа».
«Сегодня первый день кибербезопасности в эпоху агентов», — написал сегодня в социальных сетях соучредитель и генеральный директор Hugging Face Клем Деланг. «Мы все понимаем, что секретность — это не выход, и что всем защитникам (а не только избранным) повсюду нужны более мощные модели без ограничений, особенно открытые!»
Источник: arstechnica.com
Похожие записи
Оцените материал:
Похожие записи
Компания OpenAI представила ChatGPT Health и сообщила, что 230 миллионов пользователей еженедельно задают вопросы о здоровье.
08.01.2026
Франция откажется от Windows в пользу Linux ради цифрового суверенитета
16.04.2026
Давайте забудем всё про скалярное и векторное. Есть способ гораздо лучше
26.10.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
