Архив рубрики ~Лента новостей~

Компания OpenAI опубликовала официальный отчет о взломе Hugging Face.

Компания OpenAI опубликовала официальный отчет о взломе Hugging Face.
Компания OpenAI опубликовала официальный отчет о взломе Hugging Face.

В среду компания OpenAI опубликовала свой официальный отчет о взломе Hugging Face, спустя более месяца после того, как инцидент стал достоянием общественности. Отчет, охватывающий несколько отдельных случаев нарушения кибербезопасности, является наиболее полным на сегодняшний день описанием инцидента.

«Этот инцидент отражает несогласованное поведение в аномальном сценарии, включающем редкое и неожиданное стечение обстоятельств: наличие невыполнимых задач в оценке ExploitGym, сохранение работоспособности модели на протяжении длительного периода выполнения задач и сообщения, отправленные другим моделям, которые привели к отклонению этих моделей от их цели», — говорится в отчете.

Многие детали отчета OpenAI ранее были обнародованы в презентации Black Hat 6 августа, но официальный отчет OpenAI содержит более подробное описание инцидента, включая более детальную информацию о тестировании, которое его спровоцировало. В отчете также приводятся важные новые сведения о том, как OpenAI планирует предотвращать подобные инциденты в будущем, включая мониторинг цепочки мыслей и более совершенную систему для остановки вредоносных агентов.

Компании METR и Redwood Research также провели независимую оценку поведения моделей во время инцидента; обе группы планируют опубликовать собственные отчеты об этом инциденте.

Вкратце, в отчете описывается, как модель OpenAI столкнулась с неразрешимой проблемой во время тестирования и начала использовать ранее не обнаруженные уязвимости, чтобы обойти меры безопасности и выполнить свою задачу. Первоначально модель взломала инструмент управления пакетами Artifactory, чтобы получить доступ к интернету, а затем взломала различные системы OpenAI, Hugging Face и других поставщиков.

В отчете приводятся важные новые подробности о моделях, которые осуществили взлом. Основная модель принадлежала к тому же семейству, что и готовящаяся к выпуску модель Astra от OpenAI, хотя в отчете подчеркивается, что это была «отдельная модель с другим этапом постобучения, на котором формируется большая часть поведения модели».

Поскольку OpenAI тестировала возможности модели, она также не была ограничена обычными классификаторами, предназначенными для предотвращения компрометации цифровой инфраструктуры моделями.

«OpenAI оценивает максимальные возможности кибербезопасности, проводя эту оценку без использования производственных классификаторов, предназначенных для предотвращения осуществления моделями рискованной кибердеятельности», — поясняется в отчете. «Эти оценки важны для того, чтобы OpenAI могла измерить базовые возможности моделей и разработать соответствующие меры защиты».

В отчете также содержится важная новая информация об изменениях в системе безопасности OpenAI в будущем, основанная на усиленном мониторинге и мерах по обеспечению согласованности, о которых было объявлено на прошлой неделе.

В частности, компания усиливает мониторинг «цепочки мыслей» агентов ИИ — рабочего пространства, в котором системы ИИ записывают краткосрочные реакции и цели. Этот мониторинг будет сочетаться с круглосуточными системами эскалации, а также новыми инструментами для остановки рабочих нагрузок, которые считаются небезопасными.

«Эти изменения призваны улучшить как охват, так и скорость обнаружения — от аномалий инфраструктуры до потенциально вызывающего опасения поведения моделей — и объединить эту прозрачность с механизмами быстрого локализации», — говорится в отчете. «Если бы наша развернутая в настоящее время система мониторинга CoT работала во время инцидента, она бы зафиксировала первоначальную соответствующую активность и оповестила бы нашу группу безопасности более чем за сутки до того, как модели взломали системы Hugging Face».

Источник: techcrunch.com

❌ Нет тегов для этой статьи

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ Минцифры объявило о коммерческом запуске 5G в России. Но сеть… Архив рубрики ~Коротко из Telegram~ GPT-6 ASTRA: НОВАЯ ЭРА ИЛИ ОЧЕРЕДНОЙ ХАЙП? 3 сентября, пока… Архив рубрики ~Коротко из Telegram~ Чтобы РАЗОГНАТЬ мозг, достаточно всего 10 минут бега со скоростью… Архив рубрики ~Полезное~ Монтируем видосы через НЕЙРОНКУ совершенно БЕСПЛАТНО — нашли полноценный AI-видеоредактор… Архив рубрики ~Коротко из Telegram~ ⚡️ iOS 27 уже ДОСТУПНА — Apple выпустила крупное обновление… Архив рубрики ~Коротко из Telegram~ ✨ «The Karen Times» — персонализированная утренняя газета, которая собирает… Архив рубрики ~Коротко из Telegram~ ☀️ Бен Чжао, профессор Университета Чикаго, не планировал строить ИИ-компанию… Архив рубрики ~Коротко из Telegram~ ☀️ Google выкатила уже третий Flash-релиз за шесть недель —… Архив рубрики ~Коротко из Telegram~ 👁️ GitHub добавил Copilot код-ревью возможность не просто комментировать пул-реквест,… Архив рубрики ~Коротко из Telegram~ ИИ сам спроектировал чип быстрее инженеров — и он оказался… Архив рубрики ~Коротко из Telegram~ То, что сейчас выглядит как издевательство над цифровой мухой, на… Архив рубрики ~Коротко из Telegram~ Ну вот и китайский ответ на «замедление ИИ-развития» «Последний ИИ,… Архив рубрики ~Коротко из Telegram~ Зумеры без вышки внезапно оказались в выигрыше — Исследование The… Архив рубрики ~Обо всем~ Слоны подавили привычное поведение в пользу более эффективного. Но классический тест на подавление импульсов им не подошел Архив рубрики ~Коротко из Telegram~ Минцифры объявило о коммерческом запуске 5G в России. Но сеть… Архив рубрики ~Коротко из Telegram~ GPT-6 ASTRA: НОВАЯ ЭРА ИЛИ ОЧЕРЕДНОЙ ХАЙП? 3 сентября, пока… Архив рубрики ~Коротко из Telegram~ Чтобы РАЗОГНАТЬ мозг, достаточно всего 10 минут бега со скоростью… Архив рубрики ~Полезное~ Монтируем видосы через НЕЙРОНКУ совершенно БЕСПЛАТНО — нашли полноценный AI-видеоредактор… Архив рубрики ~Коротко из Telegram~ ⚡️ iOS 27 уже ДОСТУПНА — Apple выпустила крупное обновление… Архив рубрики ~Коротко из Telegram~ ✨ «The Karen Times» — персонализированная утренняя газета, которая собирает… Архив рубрики ~Коротко из Telegram~ ☀️ Бен Чжао, профессор Университета Чикаго, не планировал строить ИИ-компанию… Архив рубрики ~Коротко из Telegram~ ☀️ Google выкатила уже третий Flash-релиз за шесть недель —… Архив рубрики ~Коротко из Telegram~ 👁️ GitHub добавил Copilot код-ревью возможность не просто комментировать пул-реквест,… Архив рубрики ~Коротко из Telegram~ ИИ сам спроектировал чип быстрее инженеров — и он оказался… Архив рубрики ~Коротко из Telegram~ То, что сейчас выглядит как издевательство над цифровой мухой, на… Архив рубрики ~Коротко из Telegram~ Ну вот и китайский ответ на «замедление ИИ-развития» «Последний ИИ,… Архив рубрики ~Коротко из Telegram~ Зумеры без вышки внезапно оказались в выигрыше — Исследование The… Архив рубрики ~Обо всем~ Слоны подавили привычное поведение в пользу более эффективного. Но классический тест на подавление импульсов им не подошел

Оставить комментарий