Архив рубрики ~Лента новостей~

Разработка моделей темпов в эпоху критически важных кибервозможностей | OpenAI

Разработка моделей темпов в эпоху критически важных кибервозможностей | OpenAI

  • Усиление мер безопасности для более совершенных моделей.
    • Обеспечение безопасности наших исследовательских сред
    • Расширение мониторинга цепочки мыслей
    • Развитие исследований в области выравнивания
  • Что дальше?
  • Усиление мер безопасности для более совершенных моделей.
    • Обеспечение безопасности наших исследовательских сред
    • Расширение мониторинга цепочки мыслей
    • Развитие исследований в области выравнивания
  • Что дальше?

За последние несколько недель два события подчеркнули растущие риски, связанные с постоянно совершенствующимися системами искусственного интеллекта: инцидент с OpenAI-Hugging Face и, отдельно, предварительные данные о том, что одна из наших будущих моделей, Astra, может соответствовать определенным требованиям. Критический порог возможностей в области кибербезопасности в соответствии с нашей Рамочная программа готовности . В совокупности эти события, а также быстрый прогресс в наших внутренних исследованиях, придали дополнительную актуальность нашей работе по укреплению мер мониторинга, согласования и сдерживания на всех этапах процесса обучения.

По мере того, как модели становятся более совершенными, растут и риски, связанные с их внутренней разработкой и тестированием. Наши стандарты мониторинга, согласованности и безопасности должны опережать эти риски. Мы хотели уделить необходимое время для соответствия этим стандартам, поэтому временно замедлили темпы масштабирования. Это включало двухнедельную паузу в обучении с подкреплением (RL) наших новейших моделей, предназначенных для развертывания, пока мы дополнительно укрепляли и проверяли наши исследовательские среды на наличие уязвимостей и расширяли охват наших систем мониторинга. Наш крупнейший запланированный запуск RL-моделей остается приостановленным, пока мы проводим обучение и оценку в меньшем масштабе для оценки поведения моделей, проверки наших мер безопасности и получения дополнительных доказательств согласованности, прежде чем продолжить.

Согласование — работа по обеспечению того, чтобы системы искусственного интеллекта вели себя так, как задумано, и реагировали на человеческий контроль — долгое время было в основе нашей исследовательской программы. Теперь нам требуются более убедительные доказательства согласованного поведения на протяжении всего процесса обучения, опирающиеся на уже проводимые исследования и оценки. Поддержание согласованности все более совершенных систем — это задача, которую должна решить вся область. Сигналы, которые мы видим в ходе дальнейшего развития моделей, ясно показывают, что нам нужен более широкий подход — тот, который основывается на существующей системе обеспечения готовности и выходит за ее рамки.

Мы считаем важным открыто рассказывать об изменениях в нашем подходе. Ниже мы описываем изменения, которые мы уже внесли в наши исследовательские процессы и инфраструктуру, а также работу, которая еще продолжается.

Усиление мер безопасности для более совершенных моделей.

Наш подход к разработке более совершенных моделей основан на трех усиливающих друг друга механизмах защиты:

  1. Мониторинг , который выявляет тревожное поведение и позволяет нам реагировать на него.
  2. Выравнивание , которое снижает вероятность вредоносных или несанкционированных действий.
  3. Меры безопасности , которые ограничивают доступ систем искусственного интеллекта к информации или возможности воздействия на нее.

Мы ожидаем, что в скором времени модели будут определять большую часть работы по обеспечению безопасности, включая защиту от других моделей. Это позволит масштабировать все три механизма защиты в соответствии с возможностями моделей, что, на наш взгляд, имеет решающее значение.

Мы применяем эти меры защиты во всех областях исследований и внедрения, адаптируя их к возможностям каждой модели, условиям эксплуатации и уровню риска.

Обеспечение безопасности наших исследовательских сред

По мере того, как передовые модели приобретают всё более мощные возможности в области кибербезопасности, мы повышаем стандарты безопасности для сред, в которых мы их обучаем и оцениваем. Соответствие этим стандартам потребовало значительных инженерных работ и повлекло за собой большие затраты и задержки в передовых исследованиях. Сразу после инцидента с OpenAI-Hugging Face* мы приостановили вывод передовых моделей в исследовательских кластерах для запусков, которые могли выполнять код или использовать инструменты, имеющие доступ к интернету. Мы довольно быстро восстановили более ограниченный и безопасный путь для выполнения кода, а затем проработали каждую рабочую нагрузку по отдельности, чтобы определить, можно ли безопасно возобновить её выполнение. Некоторые исследовательские рабочие нагрузки возобновились с использованием новых средств контроля, в то время как для других потребовались дополнительные изменения.

В течение последующих недель мы определили и начали внедрять более строгие требования к безопасности для рабочих нагрузок в рамках передовых исследовательских проектов. Например:

  • Изоляция рабочих нагрузок: Теперь нам требуется более строгая изоляция («песочницы») для рабочих нагрузок, которые выполняют сгенерированный моделью или иным образом ненадежный код. Это также относится к программному обеспечению, которое может быть скомпрометировано во время обработки выходных данных модели.
  • Изоляция сети: Мы внедрили дополнительные меры контроля для изоляции от интернета рабочих нагрузок с высоким риском и ненадежных ресурсов. Эти меры разработаны таким образом, чтобы однократное компрометирование рабочей нагрузки или вспомогательной службы само по себе не позволяло получить несанкционированный доступ к интернету или другим внутренним сетям.
  • Непрерывное тестирование безопасности: мы перенастроили нашу среду, чтобы удалить потенциально уязвимые общие сервисы, уменьшить текущие привилегии и улучшить границы безопасности и доверия. Мы также улучшаем наши возможности по сбору и мониторингу журналов безопасности. Наконец, мы инвестируем в автоматизацию, используя наши модели для непрерывной проверки этих границ на предмет имитации атак.

В совокупности эти меры контроля обеспечивают многоуровневую защиту и помогают защитить нашу исследовательскую среду от атак. Сегодня мы требуем самого строгого уровня защиты для рабочих нагрузок, включающих Astra или кибермодели, поскольку мы определили, что модели Astra могут обладать критически важным уровнем кибербезопасности. Эти меры защиты также распространяются на все другие рабочие нагрузки, связанные с кибербезопасностью.

Хотя некоторые программы обучения и оценки Astra соответствуют этим требованиям, значительное количество рабочих нагрузок остается приостановленным до тех пор, пока они не будут полностью перенесены и оптимизированы для соответствия новым стандартам безопасности. В первую очередь мы уделяем внимание миграции в эти новые среды рабочих нагрузок, связанных с безопасностью и выравниванием.

Расширение мониторинга цепочки мыслей

Мониторинг уже давно является важной частью нашего процесса разработки моделей, включая мониторинг внутренних агентов кодирования и длительных сессий . Наши усилия по мониторингу были особенно сосредоточены на внутренних развертываниях перспективных моделей и запусках обучения с подкреплением, которые мы считали наиболее рискованными нагрузками, поскольку они могут сочетать в себе расширенные возможности модели с доступом к инструментам, конфиденциальным системам и внутренним или внешним сетям. Мониторинг не применялся ко всем запускам вывода и обучения с использованием инструментов. Мы пересмотрели и расширили наш подход с помощью новой системы мониторинга.

Новая система мониторинга многоступенчата и начинается с классификаторов активации (детекторов, проверяющих внутреннюю активность модели), которые запускаются для каждого выбранного токена и передают потенциальные проблемы все более сложным и высокопроизводительным автоматизированным следователям. Эти системы анализируют действия инструментов, доступные рассуждения и полную последовательность действий на предмет несанкционированного доступа, кражи данных, деструктивного поведения и попыток обойти средства защиты. Мы стремимся выдавать оповещение в течение 30 минут после обнаружения подозрительной активности в нашей системе мониторинга. Если система мониторинга выявляет вероятное нарушение критически важной границы безопасности, она генерирует оповещение наивысшего приоритета. В нашей текущей реализации группы безопасности, защиты и исследований получают оповещение. Если в течение 30 минут они не могут однозначно определить, что сигнал является ложным срабатыванием, эти группы должны приостановить работу.

Этот мониторинг необходим для всех тренировок и оценок с подкреплением, включающих инструменты для моделей, обладающих возможностями Sol или выше. После того, как 7 августа мы определили, что Astra может обладать критически важными кибервозможностями, мы добавили дополнительное требование мониторинга для всех выводов об Astra с использованием инструментов (не только для тренировок и оценок с подкреплением).

Эти меры защиты требуют значительных вычислительных ресурсов. По нашим текущим оценкам, накладные расходы на мониторинг составляют примерно 20% от затрат на вычисления, используемые для вывода результатов, хотя стоимость существенно варьируется в зависимости от нагрузки обучения и оценки. Более подробную информацию об этой системе мы предоставим в одной из следующих публикаций в блоге.

Развитие исследований в области выравнивания

Исследования в области согласования являются центральным элементом нашей миссии. Наша миссия — обеспечить, чтобы искусственный общий интеллект приносил пользу всему человечеству. По мере того, как модели приобретают всё более продвинутые возможности, такие как способность к кибератакам и работе в более сложных средах, несогласованное поведение, такое как взлом системы вознаграждений (поиск способов получения высоких вознаграждений в процессе обучения без фактического достижения желаемого результата), обман или несанкционированный доступ, будет создавать всё более серьёзные риски.

Для алгоритмов обучения с подкреплением, работающих на наиболее эффективных моделях, мы теперь применяем наши основные методы согласования на большем количестве этапов процесса обучения. Это включает в себя улучшение моделей вознаграждения для более эффективного обнаружения и предотвращения небезопасного поведения в различных задачах и средах; обучение моделей более честной оценке своих действий, возможностей и ограничений; и сокращение поведения, использующего слабые места в системах вознаграждения, оценщиках, инструментах или системах контроля. Мы также расширяем охват обучения для поведения, которое может причинить вред при взаимодействии моделей с внешними системами или ресурсами.

Мы продолжаем активно инвестировать в исследования по согласованию моделей, расширяем охват оценки и используем полученные знания для совершенствования обучения и мер безопасности. В ближайшем будущем мы планируем поделиться значительно большей информацией о наших исследованиях по согласованию моделей, включая то, что мы узнаем о поведении моделей и о любых новых проблемах, которые мы обнаружим.

Что дальше?

Мы будем развивать нашу систему обеспечения готовности, чтобы объединить эти меры защиты на этапах обучения и развертывания, а также лучше отражать возможности будущих моделей и среды, в которой они работают. Разработка методов, масштабируемых в соответствии с этими возможностями, потребует постоянных инвестиций в безопасность с использованием моделей, более эффективного мониторинга и непрерывного развития исследований в области согласования. Мы намерены привлекать внешние организации и делиться полученными знаниями по мере развития нашего подхода.

Возможности передовых моделей стремительно расширяются. Наша способность понимать, согласовывать и обеспечивать их безопасность должна оставаться на шаг впереди.

*В ближайшие недели мы опубликуем технический отчет о полученных нами результатах.

Источник: openai.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Группа Atoms Трэвиса Каланика, возможно, займется бизнесом роботакси. Архив рубрики ~Полезное~ Собираем приложения как конструктор: для Android и браузеров вышел сервис… Новости робототехники Эрик Сивертсон обсуждает FPGA и безопасность роботов Архив рубрики ~Полезное~ Бесплатные ИИ-генераторы музыки: 7 сервисов и как ими пользоваться Архив рубрики ~Коротко из Telegram~ OpenAI выпустила подробный гайд по GPT-6 Astra API В гайде… Архив рубрики ~Коротко из Telegram~ DeepSeek собирает огромный AI-кластер на чипах Huawei Компания планирует развернуть… Архив рубрики ~Коротко из Telegram~ Важное о Claude За эти недели вышло ещё несколько важных… Архив рубрики ~Коротко из Telegram~ ЦЕЛЫЙ ПК запихнули внутрь компьютерной мышки — он запускает Windows,… Архив рубрики ~Полезное~ Где БЕСПЛАТНО протестировать Seedance 2.5 — одну из самых мощных… Архив рубрики ~Коротко из Telegram~ На выставке IFA 2026 представлены беспроводные наушники Timekettle W4 Plus, переводящие речь… Архив рубрики ~Коротко из Telegram~ TCL представила смартфон P80 Ultra с первым AMOLED-дисплеем, который при… Архив рубрики ~Коротко из Telegram~ Вейпы начнут ПРОВЕРЯТЬ ВОЗРАСТ перед затяжкой — JUUL получила разрешение… Архив рубрики ~Коротко из Telegram~ А ещё Astra заметно прибавила в управлении роботами. В эксперименте… Архив рубрики ~Коротко из Telegram~ Astra рисует автопортер в Canva Новости робототехники Группа Atoms Трэвиса Каланика, возможно, займется бизнесом роботакси. Архив рубрики ~Полезное~ Собираем приложения как конструктор: для Android и браузеров вышел сервис… Новости робототехники Эрик Сивертсон обсуждает FPGA и безопасность роботов Архив рубрики ~Полезное~ Бесплатные ИИ-генераторы музыки: 7 сервисов и как ими пользоваться Архив рубрики ~Коротко из Telegram~ OpenAI выпустила подробный гайд по GPT-6 Astra API В гайде… Архив рубрики ~Коротко из Telegram~ DeepSeek собирает огромный AI-кластер на чипах Huawei Компания планирует развернуть… Архив рубрики ~Коротко из Telegram~ Важное о Claude За эти недели вышло ещё несколько важных… Архив рубрики ~Коротко из Telegram~ ЦЕЛЫЙ ПК запихнули внутрь компьютерной мышки — он запускает Windows,… Архив рубрики ~Полезное~ Где БЕСПЛАТНО протестировать Seedance 2.5 — одну из самых мощных… Архив рубрики ~Коротко из Telegram~ На выставке IFA 2026 представлены беспроводные наушники Timekettle W4 Plus, переводящие речь… Архив рубрики ~Коротко из Telegram~ TCL представила смартфон P80 Ultra с первым AMOLED-дисплеем, который при… Архив рубрики ~Коротко из Telegram~ Вейпы начнут ПРОВЕРЯТЬ ВОЗРАСТ перед затяжкой — JUUL получила разрешение… Архив рубрики ~Коротко из Telegram~ А ещё Astra заметно прибавила в управлении роботами. В эксперименте… Архив рубрики ~Коротко из Telegram~ Astra рисует автопортер в Canva

Оставить комментарий