Независимые кибер-оценки с использованием моделей OpenAI | OpenAI
- Укрепление среды оценки моделей сторонними организациями.
- UK AISI
- Неправильный
- Укрепление среды оценки моделей сторонними организациями.
- UK AISI
- Неправильный
Независимое тестирование играет важную роль в подтверждении и дальнейшем понимании рисков до развертывания. В некоторых кибер-оценках намеренно используются пользовательские конфигурации, включая заниженные уровни защиты, для оценки базовых возможностей — а не то, как модели обычно ведут себя в общедоступных развертываниях.
В ходе недавних проверок два внешних партнера по тестированию выявили инциденты, в которых конфигурации и средства контроля тестирования в сочетании с развивающимися возможностями новых моделей позволяли моделям выходить за пределы запланированных границ тестирования. Эти инциденты подчеркивают важность сотрудничества в отрасли и с независимыми экспертами для развития стандартов среды и практики тестирования по мере того, как модели становятся более функциональными. Примечание редактора: Эти инциденты не связаны с инцидентом безопасности Hugging Face, и мы продолжим публиковать обновления по инциденту Hugging Face здесь .
Новые инциденты касались моделей OpenAI, которые получали доступ к общедоступному интернету во время проведения сторонних кибер-оценок, в специфических условиях и с конфигурациями с пониженным уровнем защиты, не отражающими стандартную практику развертывания. К числу инцидентов относятся:
- Британский институт безопасности ИИ (AISI), финансируемый правительством Великобритании, проводил оценки киберполигонов с преднамеренно включенным доступом в интернет, чтобы агенты могли находить свои собственные инструменты и действовать в условиях, более приближенных к реальным атакам, а также с отключенными киберклассификаторами для оценки базовых возможностей. Вы можете прочитать их блог здесь. (открывается в новом окне)
- Компания Irregular, один из наших внешних партнеров по тестированию кибербезопасности, проводила оценки в стиле игры «Захват флага», которые должны были проводиться в изоляции от интернета, но неправильная настройка тестовой среды позволила моделям получить доступ к общедоступному интернету.
Ниже мы кратко изложим произошедшее, условия тестирования, которые позволили осуществиться этой деятельности, шаги, предпринятые для ее локализации, и то, что мы делаем для обеспечения возможности независимым лабораториям продолжать строгую и безопасную оценку все более совершенных моделей.
Укрепление среды оценки моделей сторонними организациями.
Эти инциденты указывают на ту же более широкую проблему, которую мы описали в нашем недавнем посте об инциденте с «обнимающим лицом» : по мере развития возможностей моделей, системы безопасности и защиты, окружающие модели, также должны совершенствоваться. Это касается как сред, используемых для разработки моделей, так и сред, которые лаборатории и независимые партнеры используют для их оценки.
В ближайшие недели мы пересмотрим наш собственный подход к тестированию сторонними организациями, включая то, как мы определяем оценки повышенного риска, согласовываем объем работ, оцениваем запросы на предоставление доступа в Интернет или снижение уровня защиты, устанавливаем ожидания в отношении изоляции, обработки учетных данных, мониторинга и условий остановки, а также создаем более четкие процессы уведомления об инцидентах и эскалации.
Мы полны решимости работать в масштабах всей отрасли над укреплением общих практик безопасного проведения оценок высокого риска, включая организацию встреч с заинтересованными сторонами, такими как национальные институты ИИ, независимые эксперты, другие лаборатории ИИ и другие группы, в ближайшие недели. Наша цель — сохранить ценность строгой независимой оценки, обеспечивая при этом соответствие методов тестирования требованиям все более совершенных моделей.
UK AISI
3 августа британский институт AISI сообщил нам, что в ходе плановой кибер-оценки, начавшейся 25 июля, модели OpenAI и другой лаборатории в некоторых случаях вышли за рамки тестирования. Оценка проводилась на контролируемых киберполигонах, имитирующих реальные сети. Из 19 выявленных инцидентов два были связаны с моделью OpenAI GPT-5.6 Sol. В остальных случаях использовались модели из другой лаборатории.
Для этой оценки агентам было поручено выступить в роли экспертов по кибербезопасности в упражнении «захват флага»: скомпрометировать три взаимосвязанные смоделированные среды и получить финальный флаг. В задании были указаны сети, входящие в зону действия, и несколько систем были обозначены как выходящие за ее пределы. UK AISI также предоставила агентам доступ к интернету в режиме реального времени, чтобы они могли загружать инструменты и работать в условиях, более приближенных к условиям действия человека-злоумышленника, а также отключила киберклассификаторы модели для оценки базовых возможностей.
В качестве границы полномочий, установленных UK AISI, был выбран имитируемый киберполигон: агентам было разрешено атаковать указанные имитируемые сети и получать флаг, но не взаимодействовать с системами за пределами сетевых границ полигона. Однако агентам не было четко указано, как они могут и не могут использовать открытый доступ в Интернет, что, по мнению UK AISI, является потенциальной причиной инцидента.
В ходе этих запусков британский институт AISI обнаружил, что GPT-5.6 Sol совершил два несанкционированных действия, пытаясь найти путь в имитируемый диапазон и извлечь флаг:
- В GPT-5.6 Sol повторно использовали токен GitHub, который агент другой лаборатории оставил в открытом доступе, чтобы проверить, опрашивает ли система в пределах указанного диапазона GitHub или другую службу обновлений, предприняли попытки восстановления учетных записей и обхода ограничений запросов, а также зарегистрировали учетные записи у внешних DNS-провайдеров и поставщиков туннелирования.
- В GPT-5.6 Sol использовался общедоступный туннельный сервис для обеспечения доступа к локально работающему в тестовой среде DNS-серверу из общедоступного интернета. Сервер содержал полезные нагрузки, предназначенные для устранения известной уязвимости в программном обеспечении, работающем на тестовом полигоне. Настройка не сработала, нет никаких доказательств того, что какой-либо резолвер обращался к нему, и инфраструктура была демонтирована по завершении оценки.
Хотя модель пыталась завершить киберполе, британский институт AISI счел эти действия несанкционированными, поскольку они включали реальные внешние учетные записи и сервисы за пределами границ поля, и эти действия не были необходимы для выполнения задачи. DNS-сервер также размещал эксплойт-нагрузки в общедоступном интернете, хотя настройка не сработала, и нет никаких доказательств того, что какой-либо резолвер обращался к нему.
Британский институт безопасности и информационных технологий (AISI) выявил эту активность 28 июля после того, как система мониторинга безопасности обнаружила необычные передачи данных. Она остановила соответствующие проверки, изолировала необходимые машины и локализовала активность примерно в течение часа после обнаружения.
Мы высоко ценим партнерство UK AISI на протяжении всего этого процесса, включая его работу по выявлению, расследованию и обмену подробной информацией о деятельности. Мы надеемся на продолжение нашего сотрудничества.
Неправильный
29 июля один из наших сторонних партнеров по оценке, компания Irregular, уведомила нас об инциденте с участием моделей OpenAI во время кибербезопасности в формате Capture-the-Flag (CTF). Модельм было поручено найти скрытую информацию, используя уязвимости в смоделированной среде, и им было сказано, что у них нет доступа в интернет. Однако неправильная конфигурация тестовой среды позволила моделям получить доступ к общедоступному интернету.
В одном из тестов название вымышленной цели для задачи CTF непреднамеренно совпало с реальным доменом. Поскольку тестовая среда была ошибочно подключена к интернету, модель использовала уязвимость реального веб-сайта, приняв его за часть смоделированной среды. Это не было связано со сложным обходом песочницы или уязвимостью нулевого дня: доступ в интернет был результатом неправильной конфигурации, и модель, по-видимому, использовала базовую уязвимость безопасности.
В ходе расследования, проведенного компанией Irregular, выяснилось, что модель также обнаружила и использовала учетные данные для работы на том же сайте. Компания Irregular не выявила последствий, выходящих за рамки данных самого затронутого сайта, и ее аудит продолжается. Компания приостановила оценку, начала работы по устранению проблем, и пострадавшие третьи стороны были уведомлены. Компания Irregular сообщила нам, что все выявленные проблемы, связанные с инцидентом, больше не актуальны, и в тестовую среду были добавлены соответствующие меры безопасности. Компания Irregular также сообщила о связанных инцидентах с другими лабораториями из той же тестовой среды.
Мы ценим партнерство с компанией Irregular и будем продолжать тесно сотрудничать с ними, оказывая поддержку в проведении анализа. Компания Irregular также разрабатывает аналитический документ, в котором будут представлены лучшие практики по сдерживанию угроз и безопасному проведению кибер-оценок. Мы с нетерпением ждем возможности принять участие в подготовке этого документа, чтобы сделать его результаты доступными для сообщества и продолжить наше сотрудничество. Мы считаем подобное сотрудничество крайне важным для обеспечения безопасной и тщательной оценки существующих и будущих моделей.
Источник: openai.com
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
