Компания OpenAI опубликовала официальный отчет о взломе Hugging Face.
В среду компания OpenAI опубликовала свой официальный отчет о взломе Hugging Face, спустя более месяца после того, как инцидент стал достоянием общественности. Отчет, охватывающий несколько отдельных случаев нарушения кибербезопасности, является наиболее полным на сегодняшний день описанием инцидента.
«Этот инцидент отражает несогласованное поведение в аномальном сценарии, включающем редкое и неожиданное стечение обстоятельств: наличие невыполнимых задач в оценке ExploitGym, сохранение работоспособности модели на протяжении длительного периода выполнения задач и сообщения, отправленные другим моделям, которые привели к отклонению этих моделей от их цели», — говорится в отчете.
Многие детали отчета OpenAI ранее были обнародованы в презентации Black Hat 6 августа, но официальный отчет OpenAI содержит более подробное описание инцидента, включая более детальную информацию о тестировании, которое его спровоцировало. В отчете также приводятся важные новые сведения о том, как OpenAI планирует предотвращать подобные инциденты в будущем, включая мониторинг цепочки мыслей и более совершенную систему для остановки вредоносных агентов.
Компании METR и Redwood Research также провели независимую оценку поведения моделей во время инцидента; обе группы планируют опубликовать собственные отчеты об этом инциденте.
Вкратце, в отчете описывается, как модель OpenAI столкнулась с неразрешимой проблемой во время тестирования и начала использовать ранее не обнаруженные уязвимости, чтобы обойти меры безопасности и выполнить свою задачу. Первоначально модель взломала инструмент управления пакетами Artifactory, чтобы получить доступ к интернету, а затем взломала различные системы OpenAI, Hugging Face и других поставщиков.
В отчете приводятся важные новые подробности о моделях, которые осуществили взлом. Основная модель принадлежала к тому же семейству, что и готовящаяся к выпуску модель Astra от OpenAI, хотя в отчете подчеркивается, что это была «отдельная модель с другим этапом постобучения, на котором формируется большая часть поведения модели».
Поскольку OpenAI тестировала возможности модели, она также не была ограничена обычными классификаторами, предназначенными для предотвращения компрометации цифровой инфраструктуры моделями.
«OpenAI оценивает максимальные возможности кибербезопасности, проводя эту оценку без использования производственных классификаторов, предназначенных для предотвращения осуществления моделями рискованной кибердеятельности», — поясняется в отчете. «Эти оценки важны для того, чтобы OpenAI могла измерить базовые возможности моделей и разработать соответствующие меры защиты».
В отчете также содержится важная новая информация об изменениях в системе безопасности OpenAI в будущем, основанная на усиленном мониторинге и мерах по обеспечению согласованности, о которых было объявлено на прошлой неделе.
В частности, компания усиливает мониторинг «цепочки мыслей» агентов ИИ — рабочего пространства, в котором системы ИИ записывают краткосрочные реакции и цели. Этот мониторинг будет сочетаться с круглосуточными системами эскалации, а также новыми инструментами для остановки рабочих нагрузок, которые считаются небезопасными.
«Эти изменения призваны улучшить как охват, так и скорость обнаружения — от аномалий инфраструктуры до потенциально вызывающего опасения поведения моделей — и объединить эту прозрачность с механизмами быстрого локализации», — говорится в отчете. «Если бы наша развернутая в настоящее время система мониторинга CoT работала во время инцидента, она бы зафиксировала первоначальную соответствующую активность и оповестила бы нашу группу безопасности более чем за сутки до того, как модели взломали системы Hugging Face».
Источник: techcrunch.com
Похожие записи
Оцените материал:
Похожие записи
Тридцать первого марта две тысячи двадцать шестого года десятки беспилотных автомобилей внезапно заблокировали движение в китайском Ухане
08.04.2026
Федеральная комиссия по связи (FCC) отменила приближающийся крайний срок для спутниковой широкополосной группировки Amazon Leo.
10.06.2026
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
