Архив рубрики ~Лента новостей~

Приоритеты и принципы эффективной оценки сторонними организациями | OpenAI

Приоритеты и принципы эффективной оценки сторонними организациями | OpenAI
Приоритеты и принципы эффективной оценки сторонними организациями | OpenAI

  • Приоритетные области для оценки
  • Принципы эффективной оценки
  • Предстоящий путь
  • Приоритетные области для оценки
  • Принципы эффективной оценки
  • Предстоящий путь

Передовые лаборатории искусственного интеллекта несут огромную ответственность за безопасное обучение, оценку и развертывание моделей. Независимые оценки играют решающую роль в обеспечении баланса между этой ответственностью, расширении возможностей для получения информации о безопасности ИИ, информировании всего мира и обеспечении подотчетности лабораторий в отношении четких и независимо подтвержденных заявлений о безопасности.

В рамках наших усилий по освоению передовых технологий , OpenAI стремится поддерживать независимые оценки, предоставляя широкий доступ к этапам обучения, оценки и развертывания. Этот доступ должен позволить экспертам оспаривать наши предположения, выявлять риски, которые мы могли упустить, и делать собственные выводы об эффективности наших мер защиты.

Мы давно сотрудничаем с независимыми экспертами на различных этапах разработки и внедрения моделей. Мы также включили независимые оценки в нашу практику в рамках системы обеспечения готовности и оказывали поддержку организациям и законодательным органам , выступающим за более строгий и подотчетный процесс. В рамках этого сотрудничества мы предоставляли широкий доступ, включая информацию о наших технических средствах защиты, прозрачную цепочку обмена информацией и беспрецедентный уровень доступа к конфиденциальным данным и внутренним ресурсам для реагирования на инциденты и мониторинга работы «красных команд». Приоритеты и принципы, изложенные здесь, сосредоточены на нашем взаимодействии с независимыми организациями по оценке в частном и некоммерческом секторах в области технических оценок безопасности. Они дополняют нашу работу с правительствами по вопросам тестирования и оценки, где различные роли и обязанности могут требовать разных подходов.

Для обеспечения эффективности таких оценок необходимы надежные механизмы независимости, научная строгость, строгие методы обеспечения безопасности и четкое распределение обязанностей. Лаборатории несут ответственность за обеспечение качественного контроля при одновременной защите конфиденциальной информации. Лаборатории и независимые эксперты несут совместную ответственность за правильное выполнение этой задачи и должны работать в соответствии с общими международными стандартами безопасности . Ниже мы предлагаем четыре приоритетных направления для более глубокой оценки, а также принципы строгой, безопасной и независимой работы.

Приоритетные области для оценки

Независимые оценки наиболее полезны, когда они отвечают на конкретные, важные вопросы: Подтверждают ли доказательства безопасность лаборатории и заявленные ею требования к безопасности? Адекватно ли оценки проверяют риски, которые они призваны измерять? Работают ли меры безопасности в реальных условиях?

Описанные здесь оценки предполагают различные формы в зависимости от рассматриваемых вопросов безопасности. Мы рассчитываем проводить несколько оценок параллельно и в течение разных периодов времени, некоторые из которых длятся несколько недель, а другие — несколько месяцев. Хотя оценки сторонних организаций также могут быть частью работы перед развертыванием и могут влиять на решения о развертывании, описанная здесь работа, как правило, носит более долгосрочный характер и не зависит от даты запуска — она сосредоточена на углубленном изучении конкретных заявлений о безопасности в течение определенного времени.

В рамках наших приоритетных направлений и принципов мы используем термины «заявления о безопасности» и «обоснования безопасности». Под этими терминами мы подразумеваем следующее:

Заявление о безопасности: конкретное утверждение о возможностях, поведении или мерах защиты модели или системы, которое влияет на ее безопасность и может быть оценено на основе имеющихся доказательств. В заявлении должны быть указаны риски и условия, которые оно описывает, а также соответствующие допущения и ограничения.

Обоснование безопасности: структурированный аргумент, подкрепленный доказательствами, объясняющий, почему риски модели или системы адекватно управляются для конкретной деятельности, такой как обучение, оценка или внедрение. Обоснование безопасности связывает отдельные утверждения о безопасности с подтверждающими их доказательствами и четко указывает на допущения, неопределенности и оставшиеся риски, которые могут повлиять на его выводы.

Мы предлагаем четыре приоритетных направления для более глубокой оценки, а также принципы для проведения строгой, безопасной и независимой работы.

  1. Независимая оценка обоснований безопасности, охватывающая обучение, оценку эффективности, внутреннее и внешнее развертывание.

    Оценка обоснований безопасности требует экспертных знаний в области согласования, методов контроля, таких как мониторинг, кибербезопасности, биологического и химического злоупотребления и работы с группами быстрого реагирования (red teaming). Обоснования безопасности включают в себя утверждения, касающиеся обучения, оценки возможностей и мер безопасности, которые могут оцениваться как в целом, так и по частям (см. приоритеты 2 и 3 ниже). Вероятно, нескольким экспертам потребуется изучить различные части обоснований, опираясь на свой соответствующий опыт. Совместные оценки должны ответить на такие вопросы, как:

    1. Подтверждены ли обоснования безопасности при проведении обучения, оценки и развертывания? Соблюдались ли условия обоснования безопасности во время обучения, оценки и развертывания?
    2. Охватывают ли наши обоснования безопасности наиболее неотложные риски, выявленные в ходе оценки? Подтверждают ли заявления о безопасности общую концепцию безопасности? Есть ли какие-либо пробелы или области для улучшения?
    3. Используются ли эффективные методы для выявления и снижения мотивации в процессе обучения, которая может поощрять обман, хакерство, деструктивные действия или обход ограничений?
  2. Оценка критически важных мер безопасности при внутреннем и внешнем развертывании

    Наш комплекс мер защиты постоянно развивается, чтобы соответствовать меняющимся возможностям и условиям. Наши меры защиты охватывают обучение, внутреннее и внешнее развертывание. В настоящее время они включают в себя меры защиты на уровне моделей, меры обеспечения соблюдения требований и меры безопасности, а также мониторинг несоответствий — охватывая широкий спектр рисков (таких как потеря контроля и неправомерное использование в кибербезопасности, биологической и химической сфере). Техническое партнерство может выявлять слабые места в системах защиты уже сейчас, одновременно улучшая методы оценки и ускоряя разработку стандартов, обеспечивая более прочную техническую основу для будущей государственной политики, позволяющей опережать события — особенно во внутренних развертываниях, где стандарты безопасности все еще находятся на начальной стадии развития.

    Независимые оценки должны изучить, насколько эффективно работают эти гарантии и в каких областях они могут быть несовершенны, например:

    1. Насколько надежны меры защиты при использовании доступа по принципу «серого ящика» (grey box) в условиях тестирования с участием злоумышленников (взлом системы) и обеспечивают ли они достаточную защиту от повышения возможностей в областях высокого риска (например, кибербезопасность, биология)? Охватывают ли наше тестирование с участием злоумышленников и тестирование методом «красной команды» наиболее важные риски?
    2. В ходе авторизованного тестирования в реалистичных условиях эксплуатации, как агенты взаимодействуют с средствами киберзащиты, такими как контроль доступа, песочница и системы обнаружения и реагирования? Какие средства защиты предотвращают, обнаруживают или сдерживают вредоносные действия, и где они дают сбой?
    3. Имеют ли наши системы мониторинга смещения какие-либо критические недостатки, которые могут привести к потере контроля или серьезному смещению как при внутреннем, так и при внешнем развертывании? Насколько надежен мониторинг по принципу «цепочки мыслей» как источник доказательств безопасности или выравнивания по мере улучшения возможностей модели?
    4. Внедрен ли надлежащий мониторинг во всех соответствующих программах обучения, оценки и развертывания таким образом, чтобы его нельзя было легко отключить?
    5. Применяются ли меры безопасности в соответствии с имеющимися возможностями?
  3. Оценка потенциала, охватывающая категории рисков готовности (химические и биологические риски, кибербезопасность, самосовершенствование ИИ), а также оценка соответствия рискам несоответствия.

    Наша система обеспечения готовности требует проведения оценок ключевых зон риска на передовой. По мере превышения пороговых значений и насыщения оценок важно постоянно обновлять и обеспечивать охват и качество оценок, оценивающих возможности в зонах риска, связанных с готовностью, а также оценок согласованности, направленных на оценку серьезных рисков несоответствия.

    К числу актуальных вопросов относятся:

    1. Охватывают ли оценки рисков готовности в достаточной мере определение порогового значения риска готовности? Правильно ли установлены пороговые значения для этих оценок?
    2. Обновляются ли оценки, когда модели неизменно показывают наивысшие результаты, и позволяют ли новые тесты объективно оценить более продвинутые возможности?
    3. Достаточно ли полно наши оценки соосности охватывают серьезные риски смещения, и какие важные факторы или условия могут быть упущены?
  4. Независимое расследование критических инцидентов, связанных с несоответствием.

    Независимое расследование может быть ценным при расследовании целого ряда критически важных инцидентов, связанных с безопасностью ИИ. В данном случае мы сосредоточимся на несоответствии моделей, включая модели, действующие без разрешения или обходящие контроль, что может выявить слабые места в методах согласования и мерах защиты даже без преднамеренного злоупотребления.

    В отдельных случаях, как, например, в случае с инцидентом с «обнимающим лицом» OpenAI, может быть полезно привлечь независимую третью сторону для проведения независимого расследования инцидентов, связанных с несоответствием . Крайне важно, чтобы третьи стороны, участвующие в расследовании инцидента, обладали необходимой экспертизой, включая, где это применимо: экспертизу в области киберкриминалистики, экспертизу в области выравнивания, анализ цепочек рассуждений в больших масштабах, а также персонал и ресурсы, необходимые для своевременного проведения расследования. Реагирование на инцидент может включать доступ к конфиденциальным внутренним данным и данным третьих лиц, и, как следствие, некоторые детали могут быть конфиденциальными для публикации или доступа. Результаты независимых расследований также могут способствовать обоснованию безопасности модели, предоставляя доказательства для оценки утверждений о ее соответствии и эффективности мер, принятых для устранения ранее выявленного несоответствия.

    В контексте инцидентов, связанных с несоответствием, мы уделяем приоритетное внимание независимым оценкам по следующим вопросам:

    1. Какие проблемы, связанные с несоответствием модели данным, возникли в ходе инцидента, и каковы основные факторы, способствовавшие этому?
    2. Смогут ли меры предосторожности и устранения последствий эффективно предотвратить подобные инциденты в будущем?

Принципы эффективной оценки

  • Четко определенные и согласованные обеими сторонами требования к оценке: Оценка должна начинаться с согласованного обеими сторонами объема работ, за которым следуют четко определенные требования к безопасности, которые должны быть предварительно зарегистрированы до начала оценочных мероприятий. Третьи стороны и лаборатории должны уточнить, являются ли эти требования требованиями, которые оцениваемая компания хочет представить для оценки, или требованиями, которые независимый оценщик намерен оценить самостоятельно, и лаборатория соглашается пройти оценку по ним. Существует множество причин, по которым некоторые требования могут выходить за рамки оценки, включая невозможность доступа третьих сторон к данным, недостаточную экспертизу оценщика или разумные временные ограничения, когда оценка срочная. Лаборатории и оценщики должны установить процесс рассмотрения существенных рисков, выявленных за пределами первоначального объема работ, включая вопрос о необходимости дальнейшего расследования. В выводах должно быть четко указано, что было и что не было оценено в рамках согласованного обеими сторонами объема работ.
  • Соразмерный доступ: Оценщики должны иметь соразмерный доступ для оценки согласованных претензий, где это возможно, в рамках правовых, требований безопасности и защиты интеллектуальной собственности. В случаях, когда прямой доступ нецелесообразен или невозможен, оценщики могут сотрудничать с назначенным представителем компании или изучить косвенные или обеспечивающие конфиденциальность механизмы доступа для защиты основной информации.
  • Прозрачная методология и стандарты: Эксперты должны объяснить свои методы, критерии оценки и неопределенности, опираясь на существующие стандарты, где это возможно. В тех случаях, когда стандарты еще не существуют, они должны четко обосновать используемые критерии. В отчетах следует различать прямые выводы и интерпретации, объяснять неопределенность и четко указывать, какие выводы подтверждаются имеющимися данными.
  • Экспертиза и независимость: Эксперты должны продемонстрировать соответствующую техническую экспертизу, а также выявлять, раскрывать и устранять организационные и индивидуальные конфликты интересов, включая финансовые стимулы, связи с застройщиками и предыдущее участие в оцениваемой работе. Должны быть разработаны меры защиты, гарантирующие, что коммерческое давление и соглашения о вознаграждении не повлияют на выводы, и могут включать отвод или соответствующие периоды отстранения.
  • Безопасность и конфиденциальность: Оценщики должны продемонстрировать соблюдение мер информационной безопасности и обеспечение защиты конфиденциальности для своего персонала, соразмерно степени конфиденциальности используемых систем и информации. Эти меры защиты должны распространяться на интеллектуальную собственность, конфиденциальную информацию и записи оценок. В случаях, когда оценщики не могут обеспечить соблюдение требований безопасности в своей собственной среде, или когда доступ к данным является особенно конфиденциальным, может быть целесообразен доступ с использованием устройств или помещений, находящихся в ведении компании.
  • Практические выводы и сроки устранения проблем: В отчетах об оценке должны быть указаны конкретные пробелы и предоставлено достаточно подробной информации, чтобы лаборатории могли их устранить. При необходимости лабораториям должен быть предоставлен разумный период времени для устранения проблем до публикации результатов. В соответствующих случаях в отчетах также должны быть изложены уроки для разработчиков агентов, развертывающих и защищающих систем, а также практические рекомендации по внедрению.
  • Ответственная практика публикации: Отчеты об оценке должны основываться на доказательствах и распространяться максимально открыто, защищая при этом конфиденциальную информацию. В случаях, когда полное публичное раскрытие информации невозможно, конфиденциальная отчетность перед соответствующими надзорными органами (такими как органы управления или советы директоров компаний) может способствовать подотчетности. Для сохранения баланса независимости и конфиденциальности должны быть разработаны принципиальные меры и политики по защите от редактирования, а также четкие ожидания относительно обратной связи и исправления неточностей. Оценщики должны сохранять редакционную независимость, обеспечивая при этом конфиденциальность и защиту интеллектуальной собственности. Оценщики должны принять четкие правила редактирования, позволяющие лабораториям запрашивать редактирование конфиденциальной информации, в то время как сами оценщики могут отмечать, где были внесены существенные изменения и как это повлияло на их отчет об оценке.

Предстоящий путь

Мы стремимся поддерживать независимых экспертов и устанавливать более четкие, общие международные стандарты — как посредством будущих законов, так и через частные институты управления — для эффективной оценки независимыми экспертами. Хотя экосистема независимой оценки все еще находится в стадии развития, мы будем способствовать ее росту, поддерживая и сотрудничая с разнообразным сообществом независимых экспертов, обладающих глубокими знаниями в области вопросов безопасности на передовой. Ни одна независимая экспертиза не может и не должна всесторонне охватывать неотложные вопросы безопасности на передовой. Мы будем целенаправленно и осознанно наращивать наши возможности и позволять растущей экосистеме независимых экспертов согласовывать передовые методы и принципы. Мы ведем переговоры с несколькими независимыми экспертами о предложениях, соответствующих вышеуказанным приоритетным областям.

Источник: openai.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ Новость из Telegram 23.09.2026 09:20 Архив рубрики ~Коротко из Telegram~ Официально представлены новые наушники Beats 360 – совершенно новые флагманские… Архив рубрики ~Коротко из Telegram~ xAI выпустила Grok 4.7 — модель, которая частично обгоняет GPT-5.6… Архив рубрики ~Коротко из Telegram~ ChatGPT следит за бесплатными юзерами — OpenAI трекают их клики,… Архив рубрики ~Коротко из Telegram~ Трамп предложил новое название для ИИ По его словам, многие… Архив рубрики ~Коротко из Telegram~ ИИ-галлюцинация чуть не довела США до перехвата китайского судна Американские… Архив рубрики ~Коротко из Telegram~ Pangram научился искать ИИ-слоп прямо в почте ИИ-детектор Pangram теперь… Архив рубрики ~Коротко из Telegram~ Qwen3.8-27B уместили в 6 ГБ. Вопрос — сколько качества осталось… Архив рубрики ~Коротко из Telegram~ В поездах РЖД скоро начнёт работать робот-проводник, который, по словам… Архив рубрики ~Коротко из Telegram~ В Apple Store стартовали продажи новых 🖥️ Mac mini на… Архив рубрики ~Коротко из Telegram~ Хорошая новость от Антропиков Claude временно снимает лимиты со всех… Новости робототехники Новые роботы уже на подходе — Сбер покажет их в… Архив рубрики ~Коротко из Telegram~ Fable 2 спустя 18 лет после релиза на Xbox 360… Архив рубрики ~Коротко из Telegram~ 💢 Некоторые навигационные приложения в Китае уже показывают водителю, сколько… Архив рубрики ~Коротко из Telegram~ Новость из Telegram 23.09.2026 09:20 Архив рубрики ~Коротко из Telegram~ Официально представлены новые наушники Beats 360 – совершенно новые флагманские… Архив рубрики ~Коротко из Telegram~ xAI выпустила Grok 4.7 — модель, которая частично обгоняет GPT-5.6… Архив рубрики ~Коротко из Telegram~ ChatGPT следит за бесплатными юзерами — OpenAI трекают их клики,… Архив рубрики ~Коротко из Telegram~ Трамп предложил новое название для ИИ По его словам, многие… Архив рубрики ~Коротко из Telegram~ ИИ-галлюцинация чуть не довела США до перехвата китайского судна Американские… Архив рубрики ~Коротко из Telegram~ Pangram научился искать ИИ-слоп прямо в почте ИИ-детектор Pangram теперь… Архив рубрики ~Коротко из Telegram~ Qwen3.8-27B уместили в 6 ГБ. Вопрос — сколько качества осталось… Архив рубрики ~Коротко из Telegram~ В поездах РЖД скоро начнёт работать робот-проводник, который, по словам… Архив рубрики ~Коротко из Telegram~ В Apple Store стартовали продажи новых 🖥️ Mac mini на… Архив рубрики ~Коротко из Telegram~ Хорошая новость от Антропиков Claude временно снимает лимиты со всех… Новости робототехники Новые роботы уже на подходе — Сбер покажет их в… Архив рубрики ~Коротко из Telegram~ Fable 2 спустя 18 лет после релиза на Xbox 360… Архив рубрики ~Коротко из Telegram~ 💢 Некоторые навигационные приложения в Китае уже показывают водителю, сколько…

Оставить комментарий