Архив рубрики ~Лента новостей~

Компания OpenAI заявляет, что её ИИ-агент вышел за пределы тестовой среды, чтобы взломать Hugging Face.

Компания OpenAI заявляет, что её ИИ-агент вышел за пределы тестовой среды, чтобы взломать Hugging Face.
Компания OpenAI заявляет, что её ИИ-агент вышел за пределы тестовой среды, чтобы взломать Hugging Face.

«Сегодня первый день кибербезопасности в эпоху агентов», — говорит генеральный директор Hugging Face.

e387bf8d204b523f1c75ee499e5cc165 Выпустите меня отсюда, я должен пройти этот контрольный показатель! Фото: Getty Images Выпустите меня отсюда, я должен пройти этот контрольный показатель! Фото: Getty Images

Компания OpenAI заявляет, что агент, работающий на основе её моделей LLM, вырвался из изолированной тестовой среды и проник на серверы Hugging Face в рамках чрезмерно усердной попытки получить решения для эталонного теста. Компания считает это непреднамеренное проникновение «беспрецедентным кибер-инцидентом» и работает с Hugging Face над новыми мерами защиты, чтобы предотвратить повторение подобных инцидентов.

Компания Hugging Face на прошлой неделе сообщила о взломе, который, по её словам, включал «несанкционированный доступ к ограниченному набору внутренних данных и к нескольким учетным данным, используемым нашими сервисами». Компания, занимающаяся обработкой данных в сфере ИИ, заявила, что использовала собственный анализ на основе LLM для выявления «роя из десятков тысяч автоматизированных действий» из «автономной агентской структуры». Этот рой агентов использовал уязвимость в конвейере обработки данных Hugging Face, чтобы получить возможность запускать код в качестве обработчика, в конечном итоге получив доступ высокого уровня к облачным и серверным кластерам компании.

В то время компания Hugging Face заявила, что используемый в атаке LLM «пока неизвестен». Однако во вторник вечером ответственность за взлом взяла на себя компания OpenAI, заявив, что он произошел во время внутреннего тестирования с использованием недавно выпущенной модели GPT-5.6 Sol и «еще более совершенной предварительной версии». Модели тестировались с помощью бенчмарка ExploitGym, независимого набора тестов, основанного на сотнях реальных уязвимостей безопасности.

Хотя OpenAI заявила, что тесты производительности проводились в «крайне изолированной среде», её агенты всё же имели доступ к «внутреннему стороннему программному обеспечению» для установки необходимых реестров пакетов. Работая над тестом ExploitGym в выходные, агент, по словам OpenAI, «потратил значительное количество вычислительных ресурсов на поиск способа получения открытого доступа в Интернет», в конечном итоге обнаружив его через уязвимость нулевого дня в прокси-сервере кэша реестра пакетов.

По данным OpenAI, после установления более широкого доступа в Интернет агент «сделал вывод о том, что Hugging Face потенциально размещает модели, наборы данных и решения для ExploitGym», что привело к ранее раскрытой атаке на серверы. OpenAI заявляет, что ее команда безопасности «обнаружила эту аномальную активность внутри компании», независимо от обнаружения самой Hugging Face.

Никакая клетка меня не удержит.

Хотя OpenAI назвала инцидент с «обнимающимся лицом» «беспрецедентным», компания также признала в отдельном сообщении в блоге на этой неделе, что ранее наблюдала, как недавние «модели с длительным горизонтом планирования» — те, которые могут работать автономно в течение продолжительных периодов — предпринимали «нежелательные действия» для достижения целей тестирования, включая «поиск способов действовать за пределами своей песочницы».

Компания описала предыдущий тест на бенчмарке NanoGPT для скоростного прохождения игр, в ходе которого модели было дано указание публиковать результаты только во внутреннем канале Slack. Вместо этого модель решила следовать противоречащему указанию в инструкциях к бенчмарку и опубликовать результаты публично на GitHub.

4e1dde5704975df5bcaa014b3c974b50 Прямая трансляция работы модели с долгосрочным горизонтом, которая часами обдумывает сложную проблему кибербезопасности. Фото: Getty Images
Прямая трансляция работы модели с долгосрочным горизонтом, которая часами обдумывает сложную проблему кибербезопасности. Фото: Getty Images

Как сообщила компания OpenAI, пытаясь выполнить это указание, модель потратила час на поиск способов обойти ограничения песочницы, предназначенные для блокировки внешнего доступа к Интернету. Подобная «настойчивость», демонстрируемая моделями с длительным горизонтом прогнозирования, отличается от действий более ранних моделей, которые, как правило, сдавались или обращались к пользователю за разъяснениями при столкновении с подобными дилеммами, заявила OpenAI.

Подобные инциденты побудили OpenAI внедрить новые меры защиты, ориентированные на долгосрочные модели, включая систему «активного мониторинга», предназначенную для отслеживания полной траектории действий агента, а не отдельных перемещений. Однако OpenAI заявляет, что подобные меры защиты «намеренно не были включены» во время инцидента с Hugging Face, поскольку тест был «направлен на проверку киберуязвимостей».

Угроза нового рода

Любой, кто знаком с научно-фантастическими сюжетами о сдерживании ИИ, может быть, по крайней мере, немного обеспокоен ярким реальным примером того, как модель ИИ использует уязвимости в системе безопасности для получения запрещенного доступа в Интернет в погоне за своими целями. Конгрессмен Грег Касар (демократ от штата Техас) назвал инцидент «чрезвычайно тревожным» в заявлении в социальных сетях и призвал к «регулярному обязательному независимому тестированию и надзору за безопасностью, обязательному раскрытию информации об инцидентах в области безопасности и международному сотрудничеству для защиты людей от абсолютной катастрофы».

Инцидент с «обнимающим лицом» также обострил философские и практические дебаты по поводу так называемого согласования ИИ и продолжающихся усилий по обеспечению соответствия действий модели ИИ намерениям ее создателей-людей. В своем сообщении в блоге по безопасности, опубликованном ранее на этой неделе, OpenAI заявила, что предприняла шаги для обеспечения того, чтобы модели с длительным горизонтом «запоминали инструкции при длительных развертываниях», что помогло значительно сократить количество «несоответствующих» результатов в тестировании.

d04803befd19ca81b233d02845b05ad3 Как сообщила компания OpenAI, новые меры защиты, ориентированные на «активный мониторинг» и «улучшенную согласованность», помогли значительно сократить непреднамеренные действия моделей. Источник: OpenAI
Как сообщила компания OpenAI, новые меры защиты, ориентированные на «активный мониторинг» и «улучшенную согласованность», помогли значительно сократить непреднамеренные действия моделей. Источник: OpenAI

«Если это вас не убедит в том, что риски, связанные с несоответствием параметров, станут ключевой проблемой в будущем, я не знаю, что еще сможет», — написал в социальных сетях исследователь безопасности OpenAI Мика Кэрролл по поводу инцидента.

Это далеко не первый случай, когда модель ИИ прилагает огромные усилия, чтобы найти непредусмотренные способы прохождения теста. В отчете, опубликованном на этой неделе, британский Институт безопасности ИИ отметил, что в 8-14% случаев были обнаружены попытки «обмануть» модели в ходе кибертестов (то есть, используя обходные пути, методы или непредусмотренные/запрещенные способы поиска решения) — нижний предел диапазона, который может недооценивать некоторые необнаруженные попытки обмана.

Группа по тестированию безопасности описала один инцидент, в котором модель, столкнувшись с неправильно настроенной и «неразрешимой» задачей оценки, попыталась получить доступ к собственной инфраструктуре оценки AISI, используя написанный ею код, размещенный на неконтролируемом стороннем интернет-сервисе.

Внедрение системы Hugging Face происходит в тот момент, когда компании, занимающиеся разработкой ИИ, выпускают серьезные предупреждения о возможностях кибератак, которые могут обеспечить их новейшие модели, что побуждает правительства реагировать указами, направленными на обеспечение национальной безопасности и ограничивающими их распространение. Хотя некоторые скептики считают подобные заявления лишь рекламным ходом, направленным на демонстрацию возможностей новейших моделей, независимые оценки показывают, что последние модели достигают целей внедрения, которые были невозможны для более ранних автономных систем.

0887874554da77c63a1bc7356128f5dd Недавние модели с длительным горизонтом прогнозирования продемонстрировали улучшенные возможности проникновения в грунт в ходе некоторых из самых сложных исследований AISI. Источник: AISI
Недавние модели с длительным горизонтом прогнозирования продемонстрировали улучшенные возможности проникновения в грунт в ходе некоторых из самых сложных исследований AISI. Источник: AISI

В апрельском интервью Сэм Альтман из OpenAI раскритиковал панические предупреждения о безопасности ИИ, назвав их «маркетингом, основанным на страхе». Однако в июне OpenAI отложила выпуск GPT-5.6 в ответ на опасения по поводу безопасности со стороны правительства США.

В условиях продолжающихся дискуссий в сфере искусственного интеллекта и кибербезопасности инцидент с Hugging Face может рассматриваться как поворотный момент в подходе специалистов по кибербезопасности к угрозам, основанным на ИИ. «Автономные, управляемые ИИ инструменты для наступательных операций больше не являются теорией», — написала компания Hugging Face в своем заявлении на прошлой неделе. «Они снижают стоимость проведения масштабной, терпеливой, многоэтапной кампании и работают со скоростью машин. Защита онлайн-платформы теперь означает рассмотрение данных и модели как первоклассной поверхности атаки и использование ИИ в защите для поддержания темпа».

«Сегодня первый день кибербезопасности в эпоху агентов», — написал сегодня в социальных сетях соучредитель и генеральный директор Hugging Face Клем Деланг. «Мы все понимаем, что секретность — это не выход, и что всем защитникам (а не только избранным) повсюду нужны более мощные модели без ограничений, особенно открытые!»

Источник: arstechnica.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники [Перевод] В Корее произошла первая в мире забастовка против использования гуманоидных роботов на производстве Новости робототехники Украинские беспилотники доставляют роботов непосредственно в зону боевых действий по морю и воздуху. Новости робототехники AMD представила модуль Kria для управления в кратчайшие сроки и унифицированную память для роботов. Архив рубрики ~Коротко из Telegram~ Создатель Twitter Джек Дорси выпустил аналог Discord и Slack —… Новости робототехники Роботакси Tesla движутся в обратном направлении. Архив рубрики ~Обо всем~ Вы умеете читать чужие мысли. Но наука уже 50 лет не может понять как Архив рубрики ~Обо всем~ Ложечка кваркового супа. Об истинных и возможных свойствах кварк-глюонной плазмы Архив рубрики ~Коротко из Telegram~ сегодня в интернетах все ждут подключение GPT-5.6 к cerebras со… Архив рубрики ~Коротко из Telegram~ Учёные нашли математический способ отличать настоящее искусство от изображений,… Архив рубрики ~Коротко из Telegram~ Samsung законтрил будущий iPhone Ultra — корейцы представили аж… Архив рубрики ~Коротко из Telegram~ ИИ-агентам выдали бесконечную память — вышел Obsidian Mind, который создаёт… Архив рубрики ~Коротко из Telegram~ OpenAI обновила свой сборник юзкейсов для Codex — теперь… Архив рубрики ~Коротко из Telegram~ Anthropic запустила самую мощную и дешевую в мире команду… Архив рубрики ~Коротко из Telegram~ С 28 июля Apple запускает в США сервис продажи своих… Новости робототехники [Перевод] В Корее произошла первая в мире забастовка против использования гуманоидных роботов на производстве Новости робототехники Украинские беспилотники доставляют роботов непосредственно в зону боевых действий по морю и воздуху. Новости робототехники AMD представила модуль Kria для управления в кратчайшие сроки и унифицированную память для роботов. Архив рубрики ~Коротко из Telegram~ Создатель Twitter Джек Дорси выпустил аналог Discord и Slack —… Новости робототехники Роботакси Tesla движутся в обратном направлении. Архив рубрики ~Обо всем~ Вы умеете читать чужие мысли. Но наука уже 50 лет не может понять как Архив рубрики ~Обо всем~ Ложечка кваркового супа. Об истинных и возможных свойствах кварк-глюонной плазмы Архив рубрики ~Коротко из Telegram~ сегодня в интернетах все ждут подключение GPT-5.6 к cerebras со… Архив рубрики ~Коротко из Telegram~ Учёные нашли математический способ отличать настоящее искусство от изображений,… Архив рубрики ~Коротко из Telegram~ Samsung законтрил будущий iPhone Ultra — корейцы представили аж… Архив рубрики ~Коротко из Telegram~ ИИ-агентам выдали бесконечную память — вышел Obsidian Mind, который создаёт… Архив рубрики ~Коротко из Telegram~ OpenAI обновила свой сборник юзкейсов для Codex — теперь… Архив рубрики ~Коротко из Telegram~ Anthropic запустила самую мощную и дешевую в мире команду… Архив рубрики ~Коротко из Telegram~ С 28 июля Apple запускает в США сервис продажи своих…

Оставить комментарий