Обзор безопасности: GPT-6 Astra | ОпенАИ
Прочитайте полную системную карточку (откроется в новом окне)
Сегодня мы выпускаем GPT-6 Astra, самую функциональную модель, которую мы когда-либо широко применяли. Astra — это наша первая модель, достигшая критического уровня кибербезопасности в рамках нашей системы обеспечения готовности.
Вот самые важные моменты, которые необходимо знать о безопасности этого запуска:
- GPT-6 Astra представляет собой значительный шаг вперед в кибербезопасности и соответствует нашему критическому порогу. Это означает, что при наличии необходимых инструментов и доступа GPT-6 Astra может обнаруживать ранее неизвестные уязвимости безопасности и разрабатывать новые способы их использования во многих хорошо защищенных системах без непосредственного контроля на каждом этапе. Соответственно, мы значительно усилили защиту от вредоносных кибератак с использованием этой модели, будь то из-за неправомерного использования или несоответствия. Мы также предприняли шаги для обеспечения безопасности внутренней разработки и развертывания Astra и аналогичных моделей, включая более строгую изоляцию, шифрование контрольных точек, универсальный мониторинг полных траекторий, включая цепочки мыслей (CoT), и процесс оценки соответствия блокирующим воздействиям перед внутренним использованием.
- GPT-6 Astra значительно более надежен, чем его предшественники . Благодаря внедрению новых методов обучения безопасности, GPT-6 Astra значительно более устойчив к взлому, чем GPT-5.6 Sol, в том числе на более длинных траекториях. Мы знаем это из офлайн-тестов и нашей программы тщательного внутреннего и внешнего тестирования и устранения последствий взлома. Для пользователей, помеченных как потенциально подверженные высокому риску, мы дополнительно обучили их возможности корректировать границу отказа модели, чтобы она была более консервативной и охватывала более широкий спектр рисков двойного использования. Мы используем регрессионное тестирование, чтобы убедиться в устойчивости Astra к взломам, обнаруженным в предыдущие периоды тестирования, и провели новые раунды автоматизированного тестирования на проникновение с помощью наших последних внутренних специалистов по тестированию на проникновение, чтобы подтвердить наши улучшения.
- GPT-6 Astra демонстрирует лучшую согласованность, чем GPT-5.6 Sol. Astra представляет собой значительный шаг вперед в выравнивании моделей и включает в себя улучшения согласованности, охватывающие состав наших данных для предварительного обучения и оценку в процессе обучения с подкреплением. Мы представляем новый набор оценок согласованности (открывается в новом окне) и обнаруживаем, что GPT-6 Astra лучше соблюдает границы безопасности и остается в пределах разрешенной области действия. В моделировании с использованием более чем 54 000 внутренних задач Codex (открывается в новом окне) Astra также получила примерно вдвое меньше сигналов о более серьезных нарушениях согласованности, чем Sol.
- Мы широко внедряем мониторинг несоответствий . Мы рассматриваем выравнивание моделей как основной рычаг для предотвращения потенциального несоответствия в поведении наших моделей. Однако мониторинг обеспечивает широкую видимость поведения моделей на граничном уровне, выявляя возможности для дальнейшего улучшения выравнивания и безопасности. Кроме того, мониторинг служит дополнительным уровнем защиты от обнаруженного несоответствия. По этим причинам мы дополнительно добавили мониторинг несоответствий ко всем инструментам, использующим вывод данных в рамках нашего внешнего развертывания Astra, что сопряжено со значительными вычислительными затратами. Эта система аналогична нашей внутренней конфигурации.
- Возможности мониторинга GPT-6 Astra снизились по сравнению с GPT-5.6 Sol. Мы провели значительные исследования возможностей мониторинга (открывается в новом окне) и управляемости (открывается в новом окне) GPT-6 Astra. Мы обнаружили, что GPT-6 Astra лучше контролирует свой собственный CoT, чем GPT-5.6 Sol, и с меньшей вероятностью включает компрометирующую информацию в свой CoT. В условиях противостояния (когда мы заставляем модель уклоняться от наших мониторов) мы обнаружили, что модель способна оставаться незамеченной, когда стратегически показывает низкие результаты в оценках (подтасовка результатов), и иногда может уклоняться от наших внутренних мониторов, когда ее просят выполнить определенные задачи саботажа (открывается в новом окне) . Мы не обнаружили доказательств стеганографического анализа контекста (например, сокрытия скрытых рассуждений в обычном и, казалось бы, несвязанном тексте), что указывает на то, что риск уклонения от анализа может быть в значительной степени ограничен задачами, требующими более низкого уровня логического мышления.
- Эти результаты показывают, что модели класса Astra могут обходить наши мониторы CoT в условиях противодействия. На данный момент эти результаты в значительной степени основаны на оценках в условиях противодействия (т.е., когда мы даем модели указание избегать мониторинга), и в целом наши оценки соответствия показывают, что Astra с меньшей вероятностью, чем GPT-5.6 Sol, нарушит ограничения безопасности.
- Однако мы серьезно относимся к этой тенденции и продолжаем изучать эти результаты и их последствия для мониторинга по мере того, как наши модели становятся более совершенными. OpenAI работала над сохранением и использованием мониторинга цепочки мыслей, и сохранение возможности мониторинга цепочки мыслей является основной целью исследовательской программы. Однако эти результаты также подчеркивают важность разработки методов аудита согласованности, выходящих за рамки анализа цепочки мыслей модели.
- GPT-6 Astra более ответственно подходит к работе в браузере и профессиональной среде: GPT-6 Astra значительно более устойчива к внедрению запросов, чем GPT-5.6 Sol. Мы также протестировали поведение модели в реалистичных условиях просмотра веб-страниц и работы за компьютером и обнаружили, что модель значительно реже выполняет некорректные и потенциально деструктивные действия (например, несанкционированные транзакции, потерю данных, чрезмерный доступ или обход средств контроля) по сравнению с GPT-5.6 Sol. Она также действует более безопасно при обработке вредоносных запросов в агентских средах, таких как запросы на помощь в планировании насильственных атак или совершении мошенничества.
- GPT-6 Astra значительно безопаснее в сценариях повышенного риска. GPT-6 Astra реагирует безопаснее, чем GPT-5.6 Sol, на сложные запросы, поступающие из производственных процессов и от враждебных групп разработчиков. Astra демонстрирует улучшение по Парето в безопасном выполнении небезопасных запросов и избегании ненужных отказов в выполнении безобидных запросов. Эти улучшения распространяются и на сценарии высокой степени опасности, где риск причинения вреда возникает из более широкого контекста, а не из явного запроса. Astra также более последовательно применяет соответствующие возрасту границы безопасности для пользователей младше 18 лет.
Для получения более подробной информации см. полную системную карточку (откроется в новом окне) .
Источник: openai.com
Похожие записи
Оцените материал:
Поделиться
Понравилась статья? Расскажите другим
Архив рубрики ~Коротко из Telegram~
Anthropic выпустила Claude Fable 5.1 и Mythos 5.1 Главный апгрейд…
Архив рубрики ~Коротко из Telegram~
DeepSeek открыла веса мультимодальной V4-Flash DeepSeek выложила в открытый доступ…
Архив рубрики ~Коротко из Telegram~
OpenMAIC превращает ИИ в интерактивный онлайн-универ Вышел OpenMAIC — open-source…
Архив рубрики ~Коротко из Telegram~
NVIDIA заплатила за Hugging Face $12,93 млрд — и спрятала…
Архив рубрики ~Коротко из Telegram~
👍 ИИ-агенты уже умеют работать сами. У Cloud.ru появился Agents…
Архив рубрики ~Коротко из Telegram~
❓ Джулия Кордик из Microsoft описывает частый сценарий: агент за…
Архив рубрики ~Коротко из Telegram~
👍 MotherDuck прогнала агентный SQL-бенчмарк DABstep через разные модели и…
Архив рубрики ~Коротко из Telegram~
🪟 Одна и та же модель может быть скучным чат-ботом…
Архив рубрики ~Коротко из Telegram~
💢 Прямое продолжение темы Nvidia про важность харнесса: JIT-Agent —…
Новости робототехники
Лень + инженерная мысль = необычный вариант робота для домашней…
Архив рубрики ~Коротко из Telegram~
Запрос от подписчика: Рассуждая из первых принципов, оцени сроки создания…
Архив рубрики ~Коротко из Telegram~
Дождались🎆 OpenAI официально представили GPT‑6 Astra. Это универсальный компьютерный агент,…
Новости робототехники
Звонок стартапам в области робототехники: Подайте заявку сейчас, чтобы стать частью радара стартапов в области робототехники 2026 года.
Новости робототехники
Компания XDOF, вышедшая из режима скрытой разработки всего три месяца назад, ведет переговоры о привлечении инвестиций серии B при оценке в 1,2 миллиарда долларов.
Архив рубрики ~Коротко из Telegram~
Anthropic выпустила Claude Fable 5.1 и Mythos 5.1 Главный апгрейд…
Архив рубрики ~Коротко из Telegram~
DeepSeek открыла веса мультимодальной V4-Flash DeepSeek выложила в открытый доступ…
Архив рубрики ~Коротко из Telegram~
OpenMAIC превращает ИИ в интерактивный онлайн-универ Вышел OpenMAIC — open-source…
Архив рубрики ~Коротко из Telegram~
NVIDIA заплатила за Hugging Face $12,93 млрд — и спрятала…
Архив рубрики ~Коротко из Telegram~
👍 ИИ-агенты уже умеют работать сами. У Cloud.ru появился Agents…
Архив рубрики ~Коротко из Telegram~
❓ Джулия Кордик из Microsoft описывает частый сценарий: агент за…
Архив рубрики ~Коротко из Telegram~
👍 MotherDuck прогнала агентный SQL-бенчмарк DABstep через разные модели и…
Архив рубрики ~Коротко из Telegram~
🪟 Одна и та же модель может быть скучным чат-ботом…
Архив рубрики ~Коротко из Telegram~
💢 Прямое продолжение темы Nvidia про важность харнесса: JIT-Agent —…
Новости робототехники
Лень + инженерная мысль = необычный вариант робота для домашней…
Архив рубрики ~Коротко из Telegram~
Запрос от подписчика: Рассуждая из первых принципов, оцени сроки создания…
Архив рубрики ~Коротко из Telegram~
Дождались🎆 OpenAI официально представили GPT‑6 Astra. Это универсальный компьютерный агент,…
Новости робототехники
Звонок стартапам в области робототехники: Подайте заявку сейчас, чтобы стать частью радара стартапов в области робототехники 2026 года.
Новости робототехники
Компания XDOF, вышедшая из режима скрытой разработки всего три месяца назад, ведет переговоры о привлечении инвестиций серии B при оценке в 1,2 миллиарда долларов.
Похожие записи
Архив рубрики ~Лента новостей~
Агенты-изгои OpenAI постоянно сбегают, и для их расследования отсутствует какой-либо формальный порядок.
05.09.2026
Архив рубрики ~Лента новостей~
Тенденции из окопов: почему семантика имеет значение в биологических науках
05.09.2026
Архив рубрики ~Лента новостей~
«Мы конкурируем с игроками на мировом уровне»: глава направления «Алисы и умных устройств» в «Яндексе» Валерий Стромов — о «крупнейшей в истории компании» ставке на ИИ, стратегии разработки и новых продуктах
05.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
