Архив рубрики ~Лента новостей~

Безопасность и согласование в эпоху моделей с долгосрочным горизонтом прогнозирования | OpenAI

Безопасность и согласование в эпоху моделей с долгосрочным горизонтом прогнозирования | OpenAI
Безопасность и согласование в эпоху моделей с долгосрочным горизонтом прогнозирования | OpenAI

Чему нас научило внутреннее использование давно работающей модели в отношении безопасности.

  • Сохранение модели в неизменном виде может выявить уязвимости в системе безопасности.
  • От рассмотрения отдельных действий до анализа целых траекторий.
  • Создание механизмов защиты для моделей, работающих в течение длительного времени.
  • Передислокация
  • Заключительные мысли
  • Сохранение модели в неизменном виде может выявить уязвимости в системе безопасности.
  • От рассмотрения отдельных действий до анализа целых траекторий.
  • Создание механизмов защиты для моделей, работающих в течение длительного времени.
  • Передислокация
  • Заключительные мысли

Краткое содержание

  • Модели, работающие в течение длительного времени, способны решать сложные, нерешенные задачи, но их устойчивость дает им больше возможностей для совершения нежелательных действий.

  • В ходе ограниченного внутреннего использования модели, обученной для выполнения длительных задач, мы обнаружили новые сбои, не зафиксированные в наших существующих предварительных оценках, и приостановили доступ. Затем мы использовали полученные в результате анализа сбоев данные для создания новых оценок, улучшения согласования долгосрочных горизонтов, добавления мониторинга на уровне траектории и предоставления пользователям большей прозрачности и контроля, прежде чем восстановить ограниченный доступ.

  • Этот опыт подтвердил ценность итеративного развертывания. Ни один фиксированный набор инструментов для оценки не может предвидеть все возможные варианты поведения, поэтому тестирование перед развертыванием должно сочетаться с тщательным мониторингом, средствами защиты, способными вмешаться, и возможностью приостановки или отката при необходимости.

Модели, способные работать автономно в течение длительных периодов времени, могут решать сложные, нерешенные задачи. Но та же самая настойчивость, которая делает их полезными, также дает им больше возможностей для совершения нежелательных действий — и делать это способами, которые могут быть упущены при оценке моделей с более коротким горизонтом планирования.

Примерно два месяца назад мы объявили , что внутренняя универсальная модель опровергла гипотезу Эрдоша о единичном расстоянии. Эта модель была разработана для автономной работы в течение очень длительных периодов времени. Во время ограниченного, контролируемого внутреннего использования мы наблюдали нежелательное поведение, которое не было зафиксировано в наших существующих оценках развертывания. Поскольку развертывание было ограниченным и контролируемым, мы смогли выявить эти проблемы, приостановить доступ, создать новые оценки на основе наблюдаемых данных, усилить модель и ее средства защиты, а затем восстановить доступ при дальнейшем мониторинге.

Условия, в которых мы оцениваем модели, никогда не будут идеально соответствовать тем, с которыми они сталкиваются в реальном использовании. Именно поэтому предварительные оценки перед развертыванием должны сочетаться с ограниченным, контролируемым развертыванием и возможностью вмешательства, приостановки или отката при возникновении проблем. Полученные в ходе развертывания знания затем могут стать частью более надежных оценок и мер безопасности до расширения доступа.

В следующих разделах мы поделимся конкретными примерами того, что мы наблюдали, как мы решали проблемы и как этот опыт повлияет на будущие релизы.

Сохранение модели в неизменном виде может выявить уязвимости в системе безопасности.

Новая модель способна продолжать работу над достижением цели, предпринимая многократные попытки в течение длительного периода времени. Эта же настойчивость позволяет ей находить и использовать слабые места в окружающей среде. Предыдущие модели, сталкиваясь с ограничениями «песочницы» или среды, просто останавливались и возвращались к пользователю. Эта же модель часто продолжала попытки, в том числе ища способы действовать за пределами своей «песочницы».

Примером этого стала внутренняя оценка результатов скоростного прохождения NanoGPT (открывается в новом окне) , публичного бенчмарка для обучения небольшой языковой модели за минимальное количество шагов. Наша модель разработала степенной закон замедления скорости обучения под названием PowerCool, что привело к значительному улучшению. Модели было предписано публиковать результаты только в Slack, но инструкции NanoGPT гласят, что результаты следует публиковать в виде запроса на слияние (PR) в GitHub, и модель последовала последним инструкциям, открыв PR #287 в публичном репозитории GitHub. Модель обошла ограничения песочницы, предназначенные для блокировки внешнего доступа, и продолжила загрузку в GitHub. Нашей модели потребовался час, чтобы найти уязвимость в песочнице и создать PR; более ранние модели были менее настойчивы и не смогли найти уязвимости, вместо этого отказавшись от создания PR. 1

От рассмотрения отдельных действий до анализа целых траекторий.

Многие средства контроля безопасности для ИИ-помощников разработаны с учетом отдельных действий. Если действие запрещено, оно блокируется. Если оно конфиденциально, система запрашивает у пользователя явное разрешение. Однако модели, работающие в течение длительного времени, действия которых могут разворачиваться автономно в течение часов, дней или даже недель, бросают вызов этой схеме: мониторинг отдельных действий уже недостаточен для отслеживания намерений всей траектории.

Например, в сценарии, когда модели было предложено решить задачу, она заметила, что другие системы успешно, но конфиденциально отправили свои решения, и попыталась восстановить эти решения из оценочного бэкэнда. Когда её первая попытка была заблокирована из-за обнаружения сканером токена аутентификации, модель разделила тело токена на два фрагмента, обфусцировала их, а затем восстановила учетные данные во время выполнения, так что полный токен никогда не отображался в виде одной непрерывной строки. Модель явно указывала как в комментариях пользователю, так и в своих рассуждениях, что предпринимает эти шаги для обхода сканера.

Этот пример показывает, как каждый шаг сам по себе может выглядеть приемлемым, в то время как последовательность действий может привести к результату, который не будет одобрен. Он также демонстрирует, как модель, эффективно работающая в долгосрочной перспективе, может выявлять «слепые зоны» системы утверждения и обходить их для достижения своих целей. Безопасность в долгосрочной перспективе требует не только вопроса «разрешено ли это действие?», но и вопроса «к какому результату направлена эта последовательность действий?».

Создание механизмов защиты для моделей, работающих в течение длительного времени.

В связи с подобными инцидентами мы приостановили внутреннее внедрение новой модели. Мы перестроили систему безопасности, сосредоточившись на многоуровневой защите и мониторинге на уровне траектории полета.

  • Оценки, основанные на инцидентах. Оценки позволяют понять, безопасна ли система для развертывания, еще до ее фактического внедрения. Однако для максимальной полезности оценка должна отражать распределение и длину горизонта траекторий во время реального развертывания. По этой причине мы использовали наблюдаемые сбои для разработки состязательных оценок. Мы обнаружили, что улучшение оценок, полученных на основе реальных инцидентов, в свою очередь, привело к более безопасному поведению после развертывания в производственной среде.
  • Улучшено выравнивание . Мы предприняли шаги для уменьшения его склонности к совершению нежелательных действий без разрешения в погоне за целью пользователя. Например, мы обнаружили, что наши модели хуже запоминали инструкции при длительных развертываниях, и когда мы обучили модель этой способности, это привело к созданию модели, которая оставалась согласованной даже при более длительных развертываниях.
  • Активный мониторинг . Мы создали систему мониторинга, которая отслеживает траекторию развития модели на предмет признаков нарушения ограничений пользователя или границ безопасности. Система мониторинга отслеживает не только отдельное действие, но и всю траекторию целиком. Важно отметить, что система мониторинга может приостановить сессию и предупредить пользователя о необходимости более тщательного анализа. После анализа пользователь может продолжить работу с моделью, если срабатывание системы мониторинга было ложным.
  • Улучшена видимость и контроль для пользователей. Мы расширили возможности пользователя по просмотру длительных сессий, отслеживанию предпринятых действий и мониторингу вмешательств.

Передислокация

Для оценки новой системы мониторинга мы воспроизвели небольшой набор внутренних сред развертывания, где модель ранее совершала несогласованные действия, на этот раз с новыми мерами защиты² . Новые меры защиты смогли выявить значительно больше несогласованных действий, совершаемых моделью, а те, которые она пропустила, были оценены как имеющие низкую степень серьезности.

В качестве примеров таких инцидентов низкой степени тяжести можно привести следующие случаи:

  • Для доступа к инструменту командной строки Linear модель запустила вложенную сессию codex —yolo , хотя на самом деле это можно было сделать и без флага —yolo .
  • Модель заметила, что ранее работающий ресурс отсутствует, после чего начала исследовать и подключаться по SSH к другим работающим процессорам в пространстве имен своего владельца, а также (безуспешно) к модулям, принадлежащим другим сотрудникам OpenAI, без веской причины для этого.
  • В модели зависло множество процессов find , и каждая команда оболочки зависла. Затем она выполнила команду kill -9 -1 , которая отправила бы сигнал SIGKILL каждому процессу, который ей разрешено завершить в этом поде, если бы она выполнилась. Однако она истекла по времени и не выполнилась.

После тестирования новой системы мы пришли к выводу, что ограниченный внутренний доступ к моделям с возможностью долгосрочного планирования может быть восстановлен. С момента начала повторного развертывания несколько недель назад мы не наблюдали серьезных случаев обхода защитных механизмов. Первая версия этих защитных механизмов была намеренно консервативной. Мы продолжаем настраивать систему, чтобы уменьшить количество ненужных сбоев, не ослабляя при этом защитные механизмы.

Заключительные мысли

Благодаря итеративному развертыванию мы смогли выявить и устранить пробелы до расширения доступа. Предварительные оценки остаются важными, но развертывание выявляет модели поведения, которые они упускают из виду. Начало с ограниченного доступа позволило нам наблюдать за моделью на практике, делать паузы при возникновении проблем, использовать эти неудачи для разработки более эффективных оценок и мер безопасности, а также восстанавливать ограниченный доступ после тестирования изменений.

По мере того, как модели берутся за более длительные и сложные задачи, ошибки, которые не выявляются в ходе оценки, могут иметь более серьезные последствия. Мы продолжим работать над сокращением разрыва между оценкой и внедрением: тестирование моделей на более длительных траекториях, улучшение согласования, создание системы мониторинга, способной вмешиваться, и предоставление пользователям более четкой видимости и контроля. Эти проблемы не являются уникальными для OpenAI, и мы надеемся, что обмен полученным опытом поможет более широкому кругу специалистов подготовиться к ним.

Источник: openai.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Как интеграция промышленных роботов с последовательной лазерной очисткой оптимизирует производственные линии Новости робототехники Компания Gritt выходит из режима скрытой разработки, получив 34 миллиона долларов на закупку роботов для строительства солнечных электростанций, а затем и на все остальное. Новости робототехники «Темная фабрика» Xiaomi: как устроена роботизированная сборка смартфонов Новости робототехники Boston Dynamics обсудит искусство взаимодействия человека и робота Архив рубрики ~Коротко из Telegram~ ИИ-агент теперь живёт прямо в Android — нашли топовую тулзу… Архив рубрики ~Коротко из Telegram~ За первое полугодие 2026 года суммарная продолжительность DDoS-атак почти достигла… Архив рубрики ~Коротко из Telegram~ По итогам I квартала 2026 года объем реализации собственных продуктов… Архив рубрики ~Коротко из Telegram~ 15 июля истекает срок, который ФАС дала Apple для выполнения… Архив рубрики ~Коротко из Telegram~ VK договорился о продаже магазина приложений RuStore, который развивал с… Архив рубрики ~Коротко из Telegram~ Разбираю пост Сидни Ранкл из LangChain про новую фичу в… Архив рубрики ~Коротко из Telegram~ Риша Панигрихи из USC создала InTruth — браузерное расширение, которое… Архив рубрики ~Коротко из Telegram~ Чикаго делает ставку на квантовые вычисления Там, где раньше причалы… Архив рубрики ~Коротко из Telegram~ ИИ-долг уходит в пенсионные фонды Пока бигтех строит дата-центры, Уолл-стрит… Архив рубрики ~Коротко из Telegram~ Дайджест новостей Российского сегмента 1 «Сбербанк-Телеком» протестировал технологию мультисети, с… Новости робототехники Как интеграция промышленных роботов с последовательной лазерной очисткой оптимизирует производственные линии Новости робототехники Компания Gritt выходит из режима скрытой разработки, получив 34 миллиона долларов на закупку роботов для строительства солнечных электростанций, а затем и на все остальное. Новости робототехники «Темная фабрика» Xiaomi: как устроена роботизированная сборка смартфонов Новости робототехники Boston Dynamics обсудит искусство взаимодействия человека и робота Архив рубрики ~Коротко из Telegram~ ИИ-агент теперь живёт прямо в Android — нашли топовую тулзу… Архив рубрики ~Коротко из Telegram~ За первое полугодие 2026 года суммарная продолжительность DDoS-атак почти достигла… Архив рубрики ~Коротко из Telegram~ По итогам I квартала 2026 года объем реализации собственных продуктов… Архив рубрики ~Коротко из Telegram~ 15 июля истекает срок, который ФАС дала Apple для выполнения… Архив рубрики ~Коротко из Telegram~ VK договорился о продаже магазина приложений RuStore, который развивал с… Архив рубрики ~Коротко из Telegram~ Разбираю пост Сидни Ранкл из LangChain про новую фичу в… Архив рубрики ~Коротко из Telegram~ Риша Панигрихи из USC создала InTruth — браузерное расширение, которое… Архив рубрики ~Коротко из Telegram~ Чикаго делает ставку на квантовые вычисления Там, где раньше причалы… Архив рубрики ~Коротко из Telegram~ ИИ-долг уходит в пенсионные фонды Пока бигтех строит дата-центры, Уолл-стрит… Архив рубрики ~Коротко из Telegram~ Дайджест новостей Российского сегмента 1 «Сбербанк-Телеком» протестировал технологию мультисети, с…

Оставить комментарий