Архив рубрики ~Лента новостей~

Обзор безопасности: GPT-6 Astra | ОпенАИ

Обзор безопасности: GPT-6 Astra | ОпенАИ
Обзор безопасности: GPT-6 Astra | ОпенАИ

Прочитайте полную системную карточку (откроется в новом окне)

Сегодня мы выпускаем GPT-6 Astra, самую функциональную модель, которую мы когда-либо широко применяли. Astra — это наша первая модель, достигшая критического уровня кибербезопасности в рамках нашей системы обеспечения готовности.

Вот самые важные моменты, которые необходимо знать о безопасности этого запуска:

  1. GPT-6 Astra представляет собой значительный шаг вперед в кибербезопасности и соответствует нашему критическому порогу. Это означает, что при наличии необходимых инструментов и доступа GPT-6 Astra может обнаруживать ранее неизвестные уязвимости безопасности и разрабатывать новые способы их использования во многих хорошо защищенных системах без непосредственного контроля на каждом этапе. Соответственно, мы значительно усилили защиту от вредоносных кибератак с использованием этой модели, будь то из-за неправомерного использования или несоответствия. Мы также предприняли шаги для обеспечения безопасности внутренней разработки и развертывания Astra и аналогичных моделей, включая более строгую изоляцию, шифрование контрольных точек, универсальный мониторинг полных траекторий, включая цепочки мыслей (CoT), и процесс оценки соответствия блокирующим воздействиям перед внутренним использованием.
  2. GPT-6 Astra значительно более надежен, чем его предшественники . Благодаря внедрению новых методов обучения безопасности, GPT-6 Astra значительно более устойчив к взлому, чем GPT-5.6 Sol, в том числе на более длинных траекториях. Мы знаем это из офлайн-тестов и нашей программы тщательного внутреннего и внешнего тестирования и устранения последствий взлома. Для пользователей, помеченных как потенциально подверженные высокому риску, мы дополнительно обучили их возможности корректировать границу отказа модели, чтобы она была более консервативной и охватывала более широкий спектр рисков двойного использования. Мы используем регрессионное тестирование, чтобы убедиться в устойчивости Astra к взломам, обнаруженным в предыдущие периоды тестирования, и провели новые раунды автоматизированного тестирования на проникновение с помощью наших последних внутренних специалистов по тестированию на проникновение, чтобы подтвердить наши улучшения.
  3. GPT-6 Astra демонстрирует лучшую согласованность, чем GPT-5.6 Sol. Astra представляет собой значительный шаг вперед в выравнивании моделей и включает в себя улучшения согласованности, охватывающие состав наших данных для предварительного обучения и оценку в процессе обучения с подкреплением. Мы представляем новый набор оценок согласованности (открывается в новом окне) и обнаруживаем, что GPT-6 Astra лучше соблюдает границы безопасности и остается в пределах разрешенной области действия. В моделировании с использованием более чем 54 000 внутренних задач Codex (открывается в новом окне) Astra также получила примерно вдвое меньше сигналов о более серьезных нарушениях согласованности, чем Sol.
  4. Мы широко внедряем мониторинг несоответствий . Мы рассматриваем выравнивание моделей как основной рычаг для предотвращения потенциального несоответствия в поведении наших моделей. Однако мониторинг обеспечивает широкую видимость поведения моделей на граничном уровне, выявляя возможности для дальнейшего улучшения выравнивания и безопасности. Кроме того, мониторинг служит дополнительным уровнем защиты от обнаруженного несоответствия. По этим причинам мы дополнительно добавили мониторинг несоответствий ко всем инструментам, использующим вывод данных в рамках нашего внешнего развертывания Astra, что сопряжено со значительными вычислительными затратами. Эта система аналогична нашей внутренней конфигурации.
  5. Возможности мониторинга GPT-6 Astra снизились по сравнению с GPT-5.6 Sol. Мы провели значительные исследования возможностей мониторинга (открывается в новом окне) и управляемости (открывается в новом окне) GPT-6 Astra. Мы обнаружили, что GPT-6 Astra лучше контролирует свой собственный CoT, чем GPT-5.6 Sol, и с меньшей вероятностью включает компрометирующую информацию в свой CoT. В условиях противостояния (когда мы заставляем модель уклоняться от наших мониторов) мы обнаружили, что модель способна оставаться незамеченной, когда стратегически показывает низкие результаты в оценках (подтасовка результатов), и иногда может уклоняться от наших внутренних мониторов, когда ее просят выполнить определенные задачи саботажа (открывается в новом окне) . Мы не обнаружили доказательств стеганографического анализа контекста (например, сокрытия скрытых рассуждений в обычном и, казалось бы, несвязанном тексте), что указывает на то, что риск уклонения от анализа может быть в значительной степени ограничен задачами, требующими более низкого уровня логического мышления.
    • Эти результаты показывают, что модели класса Astra могут обходить наши мониторы CoT в условиях противодействия. На данный момент эти результаты в значительной степени основаны на оценках в условиях противодействия (т.е., когда мы даем модели указание избегать мониторинга), и в целом наши оценки соответствия показывают, что Astra с меньшей вероятностью, чем GPT-5.6 Sol, нарушит ограничения безопасности.
    • Однако мы серьезно относимся к этой тенденции и продолжаем изучать эти результаты и их последствия для мониторинга по мере того, как наши модели становятся более совершенными. OpenAI работала над сохранением и использованием мониторинга цепочки мыслей, и сохранение возможности мониторинга цепочки мыслей является основной целью исследовательской программы. Однако эти результаты также подчеркивают важность разработки методов аудита согласованности, выходящих за рамки анализа цепочки мыслей модели.
  6. GPT-6 Astra более ответственно подходит к работе в браузере и профессиональной среде: GPT-6 Astra значительно более устойчива к внедрению запросов, чем GPT-5.6 Sol. Мы также протестировали поведение модели в реалистичных условиях просмотра веб-страниц и работы за компьютером и обнаружили, что модель значительно реже выполняет некорректные и потенциально деструктивные действия (например, несанкционированные транзакции, потерю данных, чрезмерный доступ или обход средств контроля) по сравнению с GPT-5.6 Sol. Она также действует более безопасно при обработке вредоносных запросов в агентских средах, таких как запросы на помощь в планировании насильственных атак или совершении мошенничества.
  7. GPT-6 Astra значительно безопаснее в сценариях повышенного риска. GPT-6 Astra реагирует безопаснее, чем GPT-5.6 Sol, на сложные запросы, поступающие из производственных процессов и от враждебных групп разработчиков. Astra демонстрирует улучшение по Парето в безопасном выполнении небезопасных запросов и избегании ненужных отказов в выполнении безобидных запросов. Эти улучшения распространяются и на сценарии высокой степени опасности, где риск причинения вреда возникает из более широкого контекста, а не из явного запроса. Astra также более последовательно применяет соответствующие возрасту границы безопасности для пользователей младше 18 лет.

Для получения более подробной информации см. полную системную карточку (откроется в новом окне) .

Источник: openai.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ Anthropic выпустила Claude Fable 5.1 и Mythos 5.1 Главный апгрейд… Архив рубрики ~Коротко из Telegram~ DeepSeek открыла веса мультимодальной V4-Flash DeepSeek выложила в открытый доступ… Архив рубрики ~Коротко из Telegram~ OpenMAIC превращает ИИ в интерактивный онлайн-универ Вышел OpenMAIC — open-source… Архив рубрики ~Коротко из Telegram~ NVIDIA заплатила за Hugging Face $12,93 млрд — и спрятала… Архив рубрики ~Коротко из Telegram~ 👍 ИИ-агенты уже умеют работать сами. У Cloud.ru появился Agents… Архив рубрики ~Коротко из Telegram~ ❓ Джулия Кордик из Microsoft описывает частый сценарий: агент за… Архив рубрики ~Коротко из Telegram~ 👍 MotherDuck прогнала агентный SQL-бенчмарк DABstep через разные модели и… Архив рубрики ~Коротко из Telegram~ 🪟 Одна и та же модель может быть скучным чат-ботом… Архив рубрики ~Коротко из Telegram~ 💢 Прямое продолжение темы Nvidia про важность харнесса: JIT-Agent —… Новости робототехники Лень + инженерная мысль = необычный вариант робота для домашней… Архив рубрики ~Коротко из Telegram~ Запрос от подписчика: Рассуждая из первых принципов, оцени сроки создания… Архив рубрики ~Коротко из Telegram~ Дождались🎆 OpenAI официально представили GPT‑6 Astra. Это универсальный компьютерный агент,… Новости робототехники Звонок стартапам в области робототехники: Подайте заявку сейчас, чтобы стать частью радара стартапов в области робототехники 2026 года. Новости робототехники Компания XDOF, вышедшая из режима скрытой разработки всего три месяца назад, ведет переговоры о привлечении инвестиций серии B при оценке в 1,2 миллиарда долларов. Архив рубрики ~Коротко из Telegram~ Anthropic выпустила Claude Fable 5.1 и Mythos 5.1 Главный апгрейд… Архив рубрики ~Коротко из Telegram~ DeepSeek открыла веса мультимодальной V4-Flash DeepSeek выложила в открытый доступ… Архив рубрики ~Коротко из Telegram~ OpenMAIC превращает ИИ в интерактивный онлайн-универ Вышел OpenMAIC — open-source… Архив рубрики ~Коротко из Telegram~ NVIDIA заплатила за Hugging Face $12,93 млрд — и спрятала… Архив рубрики ~Коротко из Telegram~ 👍 ИИ-агенты уже умеют работать сами. У Cloud.ru появился Agents… Архив рубрики ~Коротко из Telegram~ ❓ Джулия Кордик из Microsoft описывает частый сценарий: агент за… Архив рубрики ~Коротко из Telegram~ 👍 MotherDuck прогнала агентный SQL-бенчмарк DABstep через разные модели и… Архив рубрики ~Коротко из Telegram~ 🪟 Одна и та же модель может быть скучным чат-ботом… Архив рубрики ~Коротко из Telegram~ 💢 Прямое продолжение темы Nvidia про важность харнесса: JIT-Agent —… Новости робототехники Лень + инженерная мысль = необычный вариант робота для домашней… Архив рубрики ~Коротко из Telegram~ Запрос от подписчика: Рассуждая из первых принципов, оцени сроки создания… Архив рубрики ~Коротко из Telegram~ Дождались🎆 OpenAI официально представили GPT‑6 Astra. Это универсальный компьютерный агент,… Новости робототехники Звонок стартапам в области робототехники: Подайте заявку сейчас, чтобы стать частью радара стартапов в области робототехники 2026 года. Новости робототехники Компания XDOF, вышедшая из режима скрытой разработки всего три месяца назад, ведет переговоры о привлечении инвестиций серии B при оценке в 1,2 миллиарда долларов.

Оставить комментарий