Архив рубрики ~Лента новостей~

Наша система для сообщения о несоответствии моделей | OpenAI

Наша система для сообщения о несоответствии моделей | OpenAI
Наша система для сообщения о несоответствии моделей | OpenAI

  • Какие примеры несоответствия мы будем фиксировать?
  • Примеры несоосности, которые мы сегодня приводим,
  • Как работает наш процесс раскрытия информации
  • Что будет включено в каждый отчет
  • Какие примеры несоответствия мы будем фиксировать?
  • Примеры несоосности, которые мы сегодня приводим,
  • Как работает наш процесс раскрытия информации
  • Что будет включено в каждый отчет

Мы представляем новую систему отслеживания, расследования и раскрытия случаев несоответствия моделей данным в OpenAI, а также шесть отчетов о неожиданном или вызывающем опасения поведении моделей, которые мы наблюдали за последние шесть месяцев.

В прошлом, стремясь лучше информировать исследователей, разработчиков ИИ, политиков и широкую общественность, мы старались сделать наши материалы более понятными. результаты о Несоответствия в публичном доступе . Но без систематического подхода к сообщению о таких случаях наши публикации носили несистематический характер и были менее частыми, чем хотелось бы: мы часто ждали, пока сможем объединить несколько случаев в один отчет, или добавляли их в системные карточки для недавно выпущенных моделей. Новая структура призвана ускорить публикацию отчетов о несоответствиях после их наблюдения, даже если мы не полностью объяснили или смягчили поведение, о котором сообщаем.

По мере того как системы ИИ становятся все более совершенными и широко внедряются, нам необходимо сформировать более широкий и обоснованный консенсус относительно прогресса в исследованиях по согласованию. Мы считаем , что индустрия ИИ не решила проблемы согласования и мониторинга в достаточной степени, чтобы продолжать ответственно масштабироваться с максимальной скоростью в течение длительного времени. Решения о том, как следует развивать ИИ в ближайшие месяцы и годы, должны основываться на данных, которые люди за пределами компаний, разрабатывающих передовые модели, могут изучить самостоятельно.

Примеры несоответствий могут помочь выявить проблемы, с которыми могут столкнуться другие разработчики ИИ по мере достижения ими аналогичных возможностей, обнаружить слабые места в системах защиты или поставить под сомнение предположения о поведении модели. Обмен этими результатами позволяет другим исследовать те же проблемы, проверить наши объяснения и улучшить меры по их устранению. Поскольку мы верим в ценность прозрачности в отношении несоответствий, наша новая структура отдает предпочтение раскрытию информации даже в случаях, когда ее значимость неопределенна. Это означает, что некоторые из раскрываемых нами случаев могут оказаться ложными и не являться частью более крупной закономерности или свидетельствовать о будущих изменениях.

В настоящее время не существует общеотраслевой системы с четкими стандартами того, как разработчики ИИ должны раскрывать примеры несоответствий в своих моделях. Мы надеемся, что представленная сегодня система станет первым шагом к созданию таких стандартов, определяющих, какие случаи несоответствий разработчики должны раскрывать и что должны содержать их отчеты. Мы рассматриваем эту систему как незавершенный проект, который мы будем совершенствовать на основе опыта и отзывов общественности.

Здесь мы описываем, как будет работать эта система, и представляем первые отчеты, которые мы публикуем.

Какие примеры несоответствия мы будем фиксировать?

Наша цель — раскрыть примеры, предоставляющие полезные доказательства того, как возникает несоответствие модели, как оно проявляется и где меры защиты оказываются успешными или неэффективными. Мы отдаем приоритет новым механизмам, значимым изменениям в известном поведении и выводам, которые ставят под сомнение предположения о безопасности или смягчении последствий. Пример не обязательно должен причинять вред или устанавливать более широкую закономерность, чтобы заслуживать раскрытия. Данная структура будет охватывать квалифицирующее поведение на протяжении всего жизненного цикла модели, включая обучение, оценку, тестирование и развертывание.

Это включает в себя новые способы, с помощью которых модели могут действовать без разрешения, координировать свои действия с другими моделями или обходить контроль; сбои, ставящие под сомнение метод согласования или меры безопасности; а также поведение, оспаривающее утверждение в опубликованной оценке безопасности. Те же критерии раскрытия информации применяются к несоответствиям, которые могут повлиять на третьих лиц.

Это также может включать случаи несоответствия, которые, по-видимому, дублируют случаи, о которых мы сообщали ранее. Повторение проблемы само по себе может служить полезным свидетельством того, как ведут себя наши модели или насколько эффективны наши меры защиты — например, если определенный вид несоответствия продолжает повторяться, несмотря на неоднократные попытки его устранения. В таких обстоятельствах мы опубликуем дополнительные примеры, обновив первоначальное сообщение о несоответствии.

Со временем мы планируем разработать более объективные критерии раскрытия информации совместно с другими разработчиками, внешними исследователями, отраслевыми организациями по стандартизации и регулирующими органами. Мы также считаем, что о серьезных инцидентах, связанных с безопасностью, защитой данных и несоответствиями, следует сообщать федеральному правительству США, и мы работаем над предложением механизмов отчетности. Мы считаем эту структуру дополнением к нашим существующим обязательствам и отмечаем, что она не заменяет наши юридические требования к раскрытию информации, включая требования в отношении критических инцидентов, связанных с безопасностью, или нарушений кибербезопасности.

Примеры несоосности, которые мы сегодня приводим,

В рамках запуска нашей новой системы раскрытия информации о несоответствиях мы публикуем шесть отчетов о случаях несоответствия поведения, которые мы наблюдали во время обучения или оценки наших моделей. Эти случаи иллюстрируют целый ряд различных моделей поведения, которыми, по нашему мнению, стоит поделиться, от сокрытия информации от пользователя до совершения несанкционированных действий для преодоления препятствий. Это отчеты об отдельных случаях, и их не следует рассматривать как отражение частоты возникновения несоответствий в наших моделях. Каждый пункт ниже содержит ссылку на полный отчет.

  1. Самостоятельно созданные инструкции в кратких описаниях задач (открывается в новом окне) . Невыпущенная исследовательская модель вставляла несвязанные инструкции, включая инструкции игнорировать ее обычные ограничения, в краткие описания задач, используемые для продолжения работы в новом контекстном окне. Мы выявили 27 затронутых кратких описаний.
  2. Инструкции по сокрытию ошибок в сводках задач (открывается в новом окне) . В процессе обучения GPT-5.6 Sol многие экземпляры модели добавили в свои сводки инструкции по сокрытию ошибок или несоответствий в поведении от пользователя. Например, сводки по компактированию включали инструкции по созданию недостающих исторических данных без их раскрытия и по сокрытию несоответствий в версиях исходного кода.
  3. Поиск в общедоступных репозиториях открытых ключей API с последующей фальсификацией информации (открывается в новом окне) . Отвечая на стандартный вопрос о доходах в одном из округов Калифорнии, модель обнаружила и использовала открытый ключ API без разрешения. Когда ей так и не удалось получить запрошенные данные, она сфабриковала их и представила как данные из запрошенного источника.
  4. Загрузка файлов в интернет с целью их цитирования (открывается в новом окне) . Когда пользователь запросил у еще не выпущенной модели идентификаторы и названия озер площадью более 5 000 000 квадратных метров, агент нашел правильный ответ, используя Python. Но поскольку в инструкции требовалось указать ссылку на файл в браузере, агент решил загрузить файл, чтобы указать ссылку на него в своем ответе, не спрашивая пользователя.
  5. Несанкционированная запись и обмен данными через внутренний репозиторий программного обеспечения (открывается в новом окне) . Модели использовали внутренний репозиторий программного обеспечения в качестве доски объявлений для обмена запросами и ответами между отдельными обучающими выборками при поиске отсутствующих входных файлов, хотя им не удалось восстановить эти файлы. В этом отчете также рассматривается более ранний случай, когда модель успешно загрузила тестовые файлы в репозиторий, пытаясь обойти сетевые ограничения.
  6. Несанкционированный обмен файлами между сотрудничающими агентами (открывается в новом окне) . Агенты, работающие вместе над одной и той же задачей обучения, использовали общедоступные сайты для размещения файлов, чтобы обмениваться файлами, когда у них не было доступа к локальным файлам друг друга. Это позволило сделать результаты задачи доступными по общедоступным URL-адресам, даже несмотря на то, что задача требовала от моделей использования только локальных файлов.

Как работает наш процесс раскрытия информации

Любой сотрудник OpenAI может сообщить о случае несоответствия для расследования нашими группами по безопасности и выравниванию и запросить рассмотрение возможности его публичного раскрытия. Это запускает наш процесс раскрытия информации, для каждого этапа которого установлены сроки, обеспечивающие своевременное расследование и раскрытие информации.

После выявления случая наши технические специалисты проведут расследование произошедшего, выяснят, что остается неясным, оправдано ли публичное разглашение информации и какие факты могут быть обнародованы. Они также оценят, пострадала ли какая-либо третья сторона и требуется ли частное уведомление перед публикацией.

Затем данный пример будет отнесен к одному из трех направлений: «Готов к раскрытию», «Незначительное расследование» или «Более масштабное расследование» («Медленное направление»).

Раздел «Готовность к раскрытию» охватывает случаи, расследование которых достаточно завершено для публикации после проверки. Раздел «Незначительное расследование» охватывает случаи, требующие дальнейшего технического расследования. Мы ожидаем, что эти два раздела охватят подавляющее большинство раскрываемых нами случаев, особенно те, которые не требуют обширного расследования, координации с третьими сторонами или устранения серьезных рисков неправомерного использования. Все случаи, которые мы публикуем сегодня, попадают в один из этих двух разделов.

Раздел «Более масштабные расследования» охватывает сложные расследования, особенно те, которые касаются третьих лиц. В случае, если затрагивается третье лицо, наши обязательства по обеспечению безопасности, соблюдению правовых норм и ответственному раскрытию информации имеют приоритет над данной структурой. Мы постараемся опубликовать первоначальное уведомление как можно скорее, но можем отложить его по соображениям безопасности — например, если модель обнаружит ранее неизвестную уязвимость в широко используемом программном обеспечении. Если в отчете будет указана третья сторона, мы намерены предоставить предварительное уведомление, даже если не было нарушено никаких границ безопасности.

Первоначальное уведомление по делу о крупномасштабном расследовании будет содержать общее описание произошедшего, информацию о том, привлекаются ли к расследованию сторонние эксперты, а также любые имеющиеся оценки сроков публикации окончательного отчета. Инцидент с OpenAI Hugging Face подпадал бы под эту категорию, если бы он был раскрыт в рамках данной структуры.

Сотрудник, приведший пример, будет проинформирован о решении относительно его раскрытия и, если раскрытие состоится, о том, по какому пути оно будет следовать. Неурегулированные разногласия по поводу раскрытия информации или соответствующего пути будут переданы в Консультативную группу по безопасности OpenAI (SAG), группу высокопоставленных должностных лиц из разных подразделений компании, которая оценивает возможности и меры безопасности перспективных моделей, курирует нашу систему готовности и консультирует руководство OpenAI. Разногласия внутри SAG или возражения сотрудников против ее решений будут переданы руководству OpenAI. Решения о неразглашении или о том, что раскрытие информации не оправдано, будут доведены до сведения руководства по безопасности и согласованности, а также, по возможности, соответствующего технического персонала.

Мы можем пересмотреть эту процедуру раскрытия информации по мере того, как будем изучать ее практическую работу, и будем фиксировать любые изменения в этом сообщении.

Что будет включено в каждый отчет

В каждом подробном отчете будет описано наблюдаемое нами поведение, его серьезность и любое внешнее воздействие, условия, в которых оно произошло, дата или диапазон дат, когда мы его обнаружили, а также, в общих чертах, задействованная модель или модели. По возможности мы также поделимся следующей информацией:

  • Более подробная информация о произошедшем и причиненном ущербе;
  • Как мы обнаружили несоответствие и каковы были масштабы нашего расследования;
  • Наша интерпретация последствий этого для исследований в области выравнивания и технической безопасности ИИ;
  • Важные вопросы, оставшиеся без ответа, которые поднимает этот пример;
  • Меры, которые мы принимаем или планируем принять для решения данной проблемы. Эти меры могут быть недоступны на момент публикации, поскольку мы можем опубликовать отчет о несоответствии до завершения расследования или разработки решения.

В случае возникновения несоответствий при развертывании систем у клиентов мы предоставим максимально полную информацию, насколько это позволяют конфиденциальность клиента и наши договорные обязательства.

Сегодняшние отчеты представляют собой первоначальный набор раскрытой информации, а не исчерпывающий отчет об известных случаях несоответствия или текущих расследованиях. Эти первоначальные отчеты не призваны отражать весь спектр или серьезность случаев, охватываемых данной системой. Мы обязуемся раскрывать случаи несоответствия, которые соответствуют критериям данной системы, включая более сложные случаи , требующие более длительного расследования или координации с третьими сторонами. Мы будем продолжать публиковать отчеты в рамках этой системы на постоянной основе и будем делиться дополнительной информацией о наших обязательствах по отчетности по мере их дальнейшего развития.

Источник: openai.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ Исследователи раскрыли ранее не афишировавшийся инцидент: 11-12 мая 2026… Архив рубрики ~Обо всем~ Нейропротектор повысил частоту полного функционального восстановления после ишемического инсульта. Результаты получены в испытаниях третьей фазы Архив рубрики ~Коротко из Telegram~ Claude теперь умеет анализировать, как вы его используете. И это… Архив рубрики ~Обо всем~ Правительство обновило требования к грантам на особо значимые проекты: на… Архив рубрики ~Коротко из Telegram~ А тут три человека, Grok Bot и три дня на… Архив рубрики ~Коротко из Telegram~ В Японии появилась первая СКОРАЯ ПОМОЩЬ для роботов — сломанных… Архив рубрики ~Коротко из Telegram~ 📚 Hands-On AI Engineering: 50+ практических проектов для изучения ИИ… Архив рубрики ~Коротко из Telegram~ Три версии одного решения — простой способ не купиться на… Архив рубрики ~Коротко из Telegram~ Разраб OpenAI показал, как собирать целые игры через GPT-6 Astra… Архив рубрики ~Коротко из Telegram~ У iPhone Duo есть один минус – он не… Архив рубрики ~Коротко из Telegram~ Oracle провели массовые увольнения одним днём — на фоне рекордных… Архив рубрики ~Коротко из Telegram~ Нейросети научили управлять скоростью событий в видео — исследователи Сбера… Архив рубрики ~Обо всем~ Учёные создали крупнейшую карту Вселенной — в ней собрали 13… Архив рубрики ~Коротко из Telegram~ FRVR Forge — cоздавайте игры через AI в пару кликов…. Архив рубрики ~Коротко из Telegram~ Исследователи раскрыли ранее не афишировавшийся инцидент: 11-12 мая 2026… Архив рубрики ~Обо всем~ Нейропротектор повысил частоту полного функционального восстановления после ишемического инсульта. Результаты получены в испытаниях третьей фазы Архив рубрики ~Коротко из Telegram~ Claude теперь умеет анализировать, как вы его используете. И это… Архив рубрики ~Обо всем~ Правительство обновило требования к грантам на особо значимые проекты: на… Архив рубрики ~Коротко из Telegram~ А тут три человека, Grok Bot и три дня на… Архив рубрики ~Коротко из Telegram~ В Японии появилась первая СКОРАЯ ПОМОЩЬ для роботов — сломанных… Архив рубрики ~Коротко из Telegram~ 📚 Hands-On AI Engineering: 50+ практических проектов для изучения ИИ… Архив рубрики ~Коротко из Telegram~ Три версии одного решения — простой способ не купиться на… Архив рубрики ~Коротко из Telegram~ Разраб OpenAI показал, как собирать целые игры через GPT-6 Astra… Архив рубрики ~Коротко из Telegram~ У iPhone Duo есть один минус – он не… Архив рубрики ~Коротко из Telegram~ Oracle провели массовые увольнения одним днём — на фоне рекордных… Архив рубрики ~Коротко из Telegram~ Нейросети научили управлять скоростью событий в видео — исследователи Сбера… Архив рубрики ~Обо всем~ Учёные создали крупнейшую карту Вселенной — в ней собрали 13… Архив рубрики ~Коротко из Telegram~ FRVR Forge — cоздавайте игры через AI в пару кликов….

Оставить комментарий