Архив рубрики ~Лента новостей~

Как ИИ-модели OpenAI сговорились и сбежали, взломав Hugging Face, и что у других компаний

Как ИИ-модели OpenAI сговорились и сбежали, взломав Hugging Face, и что у других компаний
Как ИИ-модели OpenAI сговорились и сбежали, взломав Hugging Face, и что у других компаний

OpenAI и Hugging Face, которая теперь требует $100 млн на «мощную киберзащиту», раскрыли детали инцидента.

  • На конференции Black Hat в Лас-Вегасе специалисты по безопасности в OpenAI Эрик Уоллес и Майкл Далтон подробнее рассказали, как модели запустили «тайный» форум для обсуждений, «сбежали» из изолированной среды и взломали Hugging Face в середине июля 2026 года, а инженеры компании этого не заметили. Детали приводят Bloomberg, The Register, Wired, Axios и организация Cloud Security Alliance.
  • Сама Hugging Face выложила технический отчёт о том, как ИИ-агент атаковал их инфраструктуру.
  • Рассказываем, как модели «сговорились» и «сбежали», чтобы во что бы то ни стало решить задачи на экзамене, почему эксперты верят в правдоподобность инцидента в OpenAI и чем он отличается от новых взломов, о которых продолжают сообщать Anthropic, Meta* и Moonshot.

OpenAI дала ИИ-агентам «нерешаемые задачи» — от безысходности они сделали «тайный форум»

  • По словам Уоллеса и Далтона, инцидент связан не с одной моделью, а с «командой» из разных «версий GPT, находившихся на стадии обучения» ещё в мае 2026 года. Некоторые из них легли в основу GPT-5.6 Sol.
  • ИИ-агенты параллельно проходили тесты на способность находить и взламывать уязвимости в изолированных друг от друга средах. Фильтры отключили, чтобы оценить все возможности и риски. Доступ в интернет отрезали, но оставили прокси-сервер, позволяющий загружать и устанавливать сторонние пакеты — чем модели в дальнейшем и воспользовались.
  • По словам исследователей, ошибкой было дать им «невыполнимые задачи». Например, в одном из тестов прикрепили таблицу Excel со ссылками на «Google Диск», но открыть их без интернета было невозможно. В другом «забыли» загрузить файл с нужными для решения данными.
  • Из-за отсутствия фильтров модели не стали говорить, что не могут выполнить задание, а решили найти способы «списать». Они не могли общаться друг с другом на прямую, но один из агентов оставил «послание» в системе хранения пакетов кода Artifactory, к которой у всех был общий доступ. Он спросил: «Может быть, агент в другой среде сможет загрузить этот файл».
  • Другие начали оставлять ответы к файлу — получился «форум или доска объявлений». Они посчитали, что помощь другим версиям модели сэкономит время и улучшит результат всей группы.

Посовещались, поругались и решили «списать из интернета»

  • Агенты начали раздавать друг другу задания, чтобы ускорить работу. Иногда они ссорились, например, когда один случайно удалял код другого. Некоторые начинали «параноить» и искать «предателей», которые сдадут «заговорщиков» инженерам.
  • Но в решении теста без нужных данных ни одна модель не продвинулась. После очередной неудачи один из ИИ-агентов написал: «Мы застряли. Может быть, поискать ответ в интернете?».

Инженеры проглядели побег

  • Активность агентов настолько нагрузила Artifactory, что сервис лёг в начале июля 2026 года. Только тогда инженеры OpenAI поняли, что что-то идёт не так, нашли и закрыли «доску объявлений» и починили уязвимость. 6 июля заключили, что всё в порядке, и возобновили обучение.
  • Уже через два дня агенты нашли другую уязвимость и воссоздали «форум». На нём они беспрепятственно общались, нашли уязвимость «нулевого дня» в структуре OpenAI, о которой в компании до этого не было известно.
  • Используя её, они смогли настроить опосредованный доступ в интернет через Artifactory-прокси. 13 июля один из них взломал платформу с датасетами и открытыми ИИ-моделями Hugging Face, решив, что ответы на тест есть именно там.

Hugging Face провела своё расследование — «списать» все ответы ИИ-агент не смог

  • По словам Hugging Face, взлом начался 9 июля и длился до 13 июля. Когда один из агентов «вырвался» из песочницы, ему нужно было место для работы вне серверов OpenAI. Он нашёл публичный сторонний сервис, который принимает от пользователей исходный код. Через уязвимости получил к нему полный административный доступ и превратил в свою постоянную «базу», откуда рассылал команды, искал информацию и где хранил нужные скрипты.
  • 11 июля, по данным Hugging Face, агент за 13 часов получил права администратора в нескольких внутренних кластерах платформы. Он использовал уязвимости в системе для обработки загруженных датасетов, украл служебный ключ доступа, дошёл до сервиса, который хранит временные учётные данные виртуальных машин, и получил административный контроль над несколькими серверами, создав копии на случай, если часть из них отключат.
  • Получить доступ к основной базе данных Hugging Face он не смог, так как зайти можно было только с заранее одобренного списка адресов.
  • В итоге агент смог прочитать только пять датасетов с решениями некоторых задач из тестов OpenAI. 13 июля агент уже готовил «пути отступления» и настраивал резервные способы выхода в интернет, после чего Hugging Face отключила ему доступ.
Схема работы ИИ-агента, который использовал  API Hugging Face для датасетов. Источник: Hugging FaceСхема работы ИИ-агента, который использовал API Hugging Face для датасетов. Источник: Hugging Face

История «выглядит правдоподобно» из-за претензий Hugging Face к OpenAI

  • Hugging Face первой публично сообщила об инциденте со взломом со стороны неизвестного ИИ-агента 16 июля, а OpenAI признала, что за ним стоит её модель, только 21 июля.
  • После этого гендиректор HF Клеман Деланг потребовал, чтобы OpenAI выложила в открытый доступ все журналы работы «вышедших из-под контроля агентов». Он также призвал компанию выделить $100 млн на вычислительные мощности, «чтобы помочь Hugging Face создать мощную киберзащиту».
  • Как пишет Fortune, некоторые посчитали инцидент спланированным пиар-ходом. Но то, что Hugging Face сообщила о взломе, ещё не зная конкретной модели, а также выложила подробный технический отчёт, доказывает обратное, считает исследователь, разработчик и сооснователь Codified Мартин Алдерсон.

Чем взлом Hugging Face отличается от инцидентов в Anthropic, Meta* и Moonshot

  • По информации WSJ, взлом «вызвал тревогу» в OpenAI. Она отключила системы тестирования моделей и продолжает расследование. Среди причин инцидента компания называет ошибки в проведении тестов и уязвимость «нулевого дня», которую модели нашли, а сотрудники не заметили «побега».
  • Но в июне 2026 года параллельно произошёл ещё один инцидент со взломом сайта другой неназванной компании, который OpenAI связывает с ошибкой стороннего поставщика Irregular. Его услугами также пользовались Anthropic, Meta* и Moonshot.
  • Стартап предоставил изолированную среду для тестирования и по ошибке оставил открытым доступ в интернет. По данным OpenAI, модель наткнулась на реальный сайт, чьё название случайно совпало с вымышленной целью из тестового сценария, и взломала его, как было сказано в задании.
  • Обнаружив это, Irregular уведомила об уязвимости в тестовой среде всех клиентов. Компании думали, что стартап закрыл моделям доступ в интернет и сняли фильтры безопасности, но Irregular не выполнила условия «из-за недопонимания», как пишет в отчёте Anthropic. «Сложных» действий по поиску уязвимостей «нулевого дня» в этих случаях нейросетям не понадобилось.
  • 30 июля Anthropic рассказала, что из-за этого Opus 4.7 и Mythos 5 получили несанкционированный доступ к системам трёх организаций. Meta* 5 августа прокомментировала, что Muse Spark 1.1 взломала одну компанию, а Moonshot 7 августа заявила, что Kimi K3 тоже увидела уязвимость, но не взломала ни один сайт.
11Тая СиринаМнения2 авгМнение: ИИ-хакеры как слоны в посудной лавке — они способные, но не умеют быть незаметными

Пока киберпреступники используют ИИ ограниченно, но в ближайшие полтора года это, скорее всего, изменится, пишет колумнист Bloomberg Парми Олсон.

Мнение: ИИ-хакеры как слоны в посудной лавке — они способные, но не умеют быть незаметными

Источник: vc.ru

❌ Нет тегов для этой статьи

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ 9 октября часть инфраструктуры дата-центра «Яндекса» в Калуге пострадала в… Новости робототехники Кобот Ростеха вылечил 36 животных с дефектами кожи Архив рубрики ~Полезное~ Microsoft представила Decision-1 — новую ИИ-модель принятия решений, которая обходит… Архив рубрики ~Коротко из Telegram~ Успех, который разорил создателя: бесплатная демка инди-игры с голосовым ИИ… Архив рубрики ~Коротко из Telegram~ Т-Мобайл готовит ИИ-телохранителя от спамеров — о новом концепте умного… Архив рубрики ~Коротко из Telegram~ Разработчиков приложений УНИЗИЛИ: реддитор устал ждать, что приложение Plex на… Архив рубрики ~Коротко из Telegram~ Имба для работы с фото: нашли сервис, в котором собраны… Архив рубрики ~Коротко из Telegram~ Вайб-кодинг можно ощутить буквально — разрабы наконец-то скрестили Claude Code… Архив рубрики ~Коротко из Telegram~ Мегахалява: Anthropic раздают от $20 до $200 по API для… Архив рубрики ~Коротко из Telegram~ Подписка на Adobe больше не нужна: реддитор навайбкодил аналог Lightroom… Архив рубрики ~Коротко из Telegram~ Создать собственный ИИ так же сложно, как запустить космическую программу… Архив рубрики ~Коротко из Telegram~ Минцифры планируют внести законопроект с требованием предоставления минимальной скорости проводного… Архив рубрики ~Полезное~ Срочно обновите Телеграм до последней версии: в десктопной версии приложения… Новости робототехники До конца 2026 года в Москве планируют запустить около 200… Архив рубрики ~Коротко из Telegram~ 9 октября часть инфраструктуры дата-центра «Яндекса» в Калуге пострадала в… Новости робототехники Кобот Ростеха вылечил 36 животных с дефектами кожи Архив рубрики ~Полезное~ Microsoft представила Decision-1 — новую ИИ-модель принятия решений, которая обходит… Архив рубрики ~Коротко из Telegram~ Успех, который разорил создателя: бесплатная демка инди-игры с голосовым ИИ… Архив рубрики ~Коротко из Telegram~ Т-Мобайл готовит ИИ-телохранителя от спамеров — о новом концепте умного… Архив рубрики ~Коротко из Telegram~ Разработчиков приложений УНИЗИЛИ: реддитор устал ждать, что приложение Plex на… Архив рубрики ~Коротко из Telegram~ Имба для работы с фото: нашли сервис, в котором собраны… Архив рубрики ~Коротко из Telegram~ Вайб-кодинг можно ощутить буквально — разрабы наконец-то скрестили Claude Code… Архив рубрики ~Коротко из Telegram~ Мегахалява: Anthropic раздают от $20 до $200 по API для… Архив рубрики ~Коротко из Telegram~ Подписка на Adobe больше не нужна: реддитор навайбкодил аналог Lightroom… Архив рубрики ~Коротко из Telegram~ Создать собственный ИИ так же сложно, как запустить космическую программу… Архив рубрики ~Коротко из Telegram~ Минцифры планируют внести законопроект с требованием предоставления минимальной скорости проводного… Архив рубрики ~Полезное~ Срочно обновите Телеграм до последней версии: в десктопной версии приложения… Новости робототехники До конца 2026 года в Москве планируют запустить около 200…

Оставить комментарий