Приоритеты и принципы эффективной оценки сторонними организациями | OpenAI
- Приоритетные области для оценки
- Принципы эффективной оценки
- Предстоящий путь
- Приоритетные области для оценки
- Принципы эффективной оценки
- Предстоящий путь
Передовые лаборатории искусственного интеллекта несут огромную ответственность за безопасное обучение, оценку и развертывание моделей. Независимые оценки играют решающую роль в обеспечении баланса между этой ответственностью, расширении возможностей для получения информации о безопасности ИИ, информировании всего мира и обеспечении подотчетности лабораторий в отношении четких и независимо подтвержденных заявлений о безопасности.
В рамках наших усилий по освоению передовых технологий , OpenAI стремится поддерживать независимые оценки, предоставляя широкий доступ к этапам обучения, оценки и развертывания. Этот доступ должен позволить экспертам оспаривать наши предположения, выявлять риски, которые мы могли упустить, и делать собственные выводы об эффективности наших мер защиты.
Мы давно сотрудничаем с независимыми экспертами на различных этапах разработки и внедрения моделей. Мы также включили независимые оценки в нашу практику в рамках системы обеспечения готовности и оказывали поддержку организациям и законодательным органам , выступающим за более строгий и подотчетный процесс. В рамках этого сотрудничества мы предоставляли широкий доступ, включая информацию о наших технических средствах защиты, прозрачную цепочку обмена информацией и беспрецедентный уровень доступа к конфиденциальным данным и внутренним ресурсам для реагирования на инциденты и мониторинга работы «красных команд». Приоритеты и принципы, изложенные здесь, сосредоточены на нашем взаимодействии с независимыми организациями по оценке в частном и некоммерческом секторах в области технических оценок безопасности. Они дополняют нашу работу с правительствами по вопросам тестирования и оценки, где различные роли и обязанности могут требовать разных подходов.
Для обеспечения эффективности таких оценок необходимы надежные механизмы независимости, научная строгость, строгие методы обеспечения безопасности и четкое распределение обязанностей. Лаборатории несут ответственность за обеспечение качественного контроля при одновременной защите конфиденциальной информации. Лаборатории и независимые эксперты несут совместную ответственность за правильное выполнение этой задачи и должны работать в соответствии с общими международными стандартами безопасности . Ниже мы предлагаем четыре приоритетных направления для более глубокой оценки, а также принципы строгой, безопасной и независимой работы.
Приоритетные области для оценки
Независимые оценки наиболее полезны, когда они отвечают на конкретные, важные вопросы: Подтверждают ли доказательства безопасность лаборатории и заявленные ею требования к безопасности? Адекватно ли оценки проверяют риски, которые они призваны измерять? Работают ли меры безопасности в реальных условиях?
Описанные здесь оценки предполагают различные формы в зависимости от рассматриваемых вопросов безопасности. Мы рассчитываем проводить несколько оценок параллельно и в течение разных периодов времени, некоторые из которых длятся несколько недель, а другие — несколько месяцев. Хотя оценки сторонних организаций также могут быть частью работы перед развертыванием и могут влиять на решения о развертывании, описанная здесь работа, как правило, носит более долгосрочный характер и не зависит от даты запуска — она сосредоточена на углубленном изучении конкретных заявлений о безопасности в течение определенного времени.
В рамках наших приоритетных направлений и принципов мы используем термины «заявления о безопасности» и «обоснования безопасности». Под этими терминами мы подразумеваем следующее:
Заявление о безопасности: конкретное утверждение о возможностях, поведении или мерах защиты модели или системы, которое влияет на ее безопасность и может быть оценено на основе имеющихся доказательств. В заявлении должны быть указаны риски и условия, которые оно описывает, а также соответствующие допущения и ограничения.
Обоснование безопасности: структурированный аргумент, подкрепленный доказательствами, объясняющий, почему риски модели или системы адекватно управляются для конкретной деятельности, такой как обучение, оценка или внедрение. Обоснование безопасности связывает отдельные утверждения о безопасности с подтверждающими их доказательствами и четко указывает на допущения, неопределенности и оставшиеся риски, которые могут повлиять на его выводы.
Мы предлагаем четыре приоритетных направления для более глубокой оценки, а также принципы для проведения строгой, безопасной и независимой работы.
- Независимая оценка обоснований безопасности, охватывающая обучение, оценку эффективности, внутреннее и внешнее развертывание.
Оценка обоснований безопасности требует экспертных знаний в области согласования, методов контроля, таких как мониторинг, кибербезопасности, биологического и химического злоупотребления и работы с группами быстрого реагирования (red teaming). Обоснования безопасности включают в себя утверждения, касающиеся обучения, оценки возможностей и мер безопасности, которые могут оцениваться как в целом, так и по частям (см. приоритеты 2 и 3 ниже). Вероятно, нескольким экспертам потребуется изучить различные части обоснований, опираясь на свой соответствующий опыт. Совместные оценки должны ответить на такие вопросы, как:
- Подтверждены ли обоснования безопасности при проведении обучения, оценки и развертывания? Соблюдались ли условия обоснования безопасности во время обучения, оценки и развертывания?
- Охватывают ли наши обоснования безопасности наиболее неотложные риски, выявленные в ходе оценки? Подтверждают ли заявления о безопасности общую концепцию безопасности? Есть ли какие-либо пробелы или области для улучшения?
- Используются ли эффективные методы для выявления и снижения мотивации в процессе обучения, которая может поощрять обман, хакерство, деструктивные действия или обход ограничений?
- Оценка критически важных мер безопасности при внутреннем и внешнем развертывании
Наш комплекс мер защиты постоянно развивается, чтобы соответствовать меняющимся возможностям и условиям. Наши меры защиты охватывают обучение, внутреннее и внешнее развертывание. В настоящее время они включают в себя меры защиты на уровне моделей, меры обеспечения соблюдения требований и меры безопасности, а также мониторинг несоответствий — охватывая широкий спектр рисков (таких как потеря контроля и неправомерное использование в кибербезопасности, биологической и химической сфере). Техническое партнерство может выявлять слабые места в системах защиты уже сейчас, одновременно улучшая методы оценки и ускоряя разработку стандартов, обеспечивая более прочную техническую основу для будущей государственной политики, позволяющей опережать события — особенно во внутренних развертываниях, где стандарты безопасности все еще находятся на начальной стадии развития.
Независимые оценки должны изучить, насколько эффективно работают эти гарантии и в каких областях они могут быть несовершенны, например:
- Насколько надежны меры защиты при использовании доступа по принципу «серого ящика» (grey box) в условиях тестирования с участием злоумышленников (взлом системы) и обеспечивают ли они достаточную защиту от повышения возможностей в областях высокого риска (например, кибербезопасность, биология)? Охватывают ли наше тестирование с участием злоумышленников и тестирование методом «красной команды» наиболее важные риски?
- В ходе авторизованного тестирования в реалистичных условиях эксплуатации, как агенты взаимодействуют с средствами киберзащиты, такими как контроль доступа, песочница и системы обнаружения и реагирования? Какие средства защиты предотвращают, обнаруживают или сдерживают вредоносные действия, и где они дают сбой?
- Имеют ли наши системы мониторинга смещения какие-либо критические недостатки, которые могут привести к потере контроля или серьезному смещению как при внутреннем, так и при внешнем развертывании? Насколько надежен мониторинг по принципу «цепочки мыслей» как источник доказательств безопасности или выравнивания по мере улучшения возможностей модели?
- Внедрен ли надлежащий мониторинг во всех соответствующих программах обучения, оценки и развертывания таким образом, чтобы его нельзя было легко отключить?
- Применяются ли меры безопасности в соответствии с имеющимися возможностями?
- Оценка потенциала, охватывающая категории рисков готовности (химические и биологические риски, кибербезопасность, самосовершенствование ИИ), а также оценка соответствия рискам несоответствия.
Наша система обеспечения готовности требует проведения оценок ключевых зон риска на передовой. По мере превышения пороговых значений и насыщения оценок важно постоянно обновлять и обеспечивать охват и качество оценок, оценивающих возможности в зонах риска, связанных с готовностью, а также оценок согласованности, направленных на оценку серьезных рисков несоответствия.
К числу актуальных вопросов относятся:
- Охватывают ли оценки рисков готовности в достаточной мере определение порогового значения риска готовности? Правильно ли установлены пороговые значения для этих оценок?
- Обновляются ли оценки, когда модели неизменно показывают наивысшие результаты, и позволяют ли новые тесты объективно оценить более продвинутые возможности?
- Достаточно ли полно наши оценки соосности охватывают серьезные риски смещения, и какие важные факторы или условия могут быть упущены?
- Независимое расследование критических инцидентов, связанных с несоответствием.
Независимое расследование может быть ценным при расследовании целого ряда критически важных инцидентов, связанных с безопасностью ИИ. В данном случае мы сосредоточимся на несоответствии моделей, включая модели, действующие без разрешения или обходящие контроль, что может выявить слабые места в методах согласования и мерах защиты даже без преднамеренного злоупотребления.
В отдельных случаях, как, например, в случае с инцидентом с «обнимающим лицом» OpenAI, может быть полезно привлечь независимую третью сторону для проведения независимого расследования инцидентов, связанных с несоответствием . Крайне важно, чтобы третьи стороны, участвующие в расследовании инцидента, обладали необходимой экспертизой, включая, где это применимо: экспертизу в области киберкриминалистики, экспертизу в области выравнивания, анализ цепочек рассуждений в больших масштабах, а также персонал и ресурсы, необходимые для своевременного проведения расследования. Реагирование на инцидент может включать доступ к конфиденциальным внутренним данным и данным третьих лиц, и, как следствие, некоторые детали могут быть конфиденциальными для публикации или доступа. Результаты независимых расследований также могут способствовать обоснованию безопасности модели, предоставляя доказательства для оценки утверждений о ее соответствии и эффективности мер, принятых для устранения ранее выявленного несоответствия.
В контексте инцидентов, связанных с несоответствием, мы уделяем приоритетное внимание независимым оценкам по следующим вопросам:
- Какие проблемы, связанные с несоответствием модели данным, возникли в ходе инцидента, и каковы основные факторы, способствовавшие этому?
- Смогут ли меры предосторожности и устранения последствий эффективно предотвратить подобные инциденты в будущем?
Принципы эффективной оценки
- Четко определенные и согласованные обеими сторонами требования к оценке: Оценка должна начинаться с согласованного обеими сторонами объема работ, за которым следуют четко определенные требования к безопасности, которые должны быть предварительно зарегистрированы до начала оценочных мероприятий. Третьи стороны и лаборатории должны уточнить, являются ли эти требования требованиями, которые оцениваемая компания хочет представить для оценки, или требованиями, которые независимый оценщик намерен оценить самостоятельно, и лаборатория соглашается пройти оценку по ним. Существует множество причин, по которым некоторые требования могут выходить за рамки оценки, включая невозможность доступа третьих сторон к данным, недостаточную экспертизу оценщика или разумные временные ограничения, когда оценка срочная. Лаборатории и оценщики должны установить процесс рассмотрения существенных рисков, выявленных за пределами первоначального объема работ, включая вопрос о необходимости дальнейшего расследования. В выводах должно быть четко указано, что было и что не было оценено в рамках согласованного обеими сторонами объема работ.
- Соразмерный доступ: Оценщики должны иметь соразмерный доступ для оценки согласованных претензий, где это возможно, в рамках правовых, требований безопасности и защиты интеллектуальной собственности. В случаях, когда прямой доступ нецелесообразен или невозможен, оценщики могут сотрудничать с назначенным представителем компании или изучить косвенные или обеспечивающие конфиденциальность механизмы доступа для защиты основной информации.
- Прозрачная методология и стандарты: Эксперты должны объяснить свои методы, критерии оценки и неопределенности, опираясь на существующие стандарты, где это возможно. В тех случаях, когда стандарты еще не существуют, они должны четко обосновать используемые критерии. В отчетах следует различать прямые выводы и интерпретации, объяснять неопределенность и четко указывать, какие выводы подтверждаются имеющимися данными.
- Экспертиза и независимость: Эксперты должны продемонстрировать соответствующую техническую экспертизу, а также выявлять, раскрывать и устранять организационные и индивидуальные конфликты интересов, включая финансовые стимулы, связи с застройщиками и предыдущее участие в оцениваемой работе. Должны быть разработаны меры защиты, гарантирующие, что коммерческое давление и соглашения о вознаграждении не повлияют на выводы, и могут включать отвод или соответствующие периоды отстранения.
- Безопасность и конфиденциальность: Оценщики должны продемонстрировать соблюдение мер информационной безопасности и обеспечение защиты конфиденциальности для своего персонала, соразмерно степени конфиденциальности используемых систем и информации. Эти меры защиты должны распространяться на интеллектуальную собственность, конфиденциальную информацию и записи оценок. В случаях, когда оценщики не могут обеспечить соблюдение требований безопасности в своей собственной среде, или когда доступ к данным является особенно конфиденциальным, может быть целесообразен доступ с использованием устройств или помещений, находящихся в ведении компании.
- Практические выводы и сроки устранения проблем: В отчетах об оценке должны быть указаны конкретные пробелы и предоставлено достаточно подробной информации, чтобы лаборатории могли их устранить. При необходимости лабораториям должен быть предоставлен разумный период времени для устранения проблем до публикации результатов. В соответствующих случаях в отчетах также должны быть изложены уроки для разработчиков агентов, развертывающих и защищающих систем, а также практические рекомендации по внедрению.
- Ответственная практика публикации: Отчеты об оценке должны основываться на доказательствах и распространяться максимально открыто, защищая при этом конфиденциальную информацию. В случаях, когда полное публичное раскрытие информации невозможно, конфиденциальная отчетность перед соответствующими надзорными органами (такими как органы управления или советы директоров компаний) может способствовать подотчетности. Для сохранения баланса независимости и конфиденциальности должны быть разработаны принципиальные меры и политики по защите от редактирования, а также четкие ожидания относительно обратной связи и исправления неточностей. Оценщики должны сохранять редакционную независимость, обеспечивая при этом конфиденциальность и защиту интеллектуальной собственности. Оценщики должны принять четкие правила редактирования, позволяющие лабораториям запрашивать редактирование конфиденциальной информации, в то время как сами оценщики могут отмечать, где были внесены существенные изменения и как это повлияло на их отчет об оценке.
Предстоящий путь
Мы стремимся поддерживать независимых экспертов и устанавливать более четкие, общие международные стандарты — как посредством будущих законов, так и через частные институты управления — для эффективной оценки независимыми экспертами. Хотя экосистема независимой оценки все еще находится в стадии развития, мы будем способствовать ее росту, поддерживая и сотрудничая с разнообразным сообществом независимых экспертов, обладающих глубокими знаниями в области вопросов безопасности на передовой. Ни одна независимая экспертиза не может и не должна всесторонне охватывать неотложные вопросы безопасности на передовой. Мы будем целенаправленно и осознанно наращивать наши возможности и позволять растущей экосистеме независимых экспертов согласовывать передовые методы и принципы. Мы ведем переговоры с несколькими независимыми экспертами о предложениях, соответствующих вышеуказанным приоритетным областям.
Источник: openai.com
Похожие записи
Оцените материал:
Похожие записи
«Мы уже ведем вчерашнюю битву»: премьер-министр Греции откровенно высказался об искусственном интеллекте.
23.09.2026
«Гравитон» готовит к выпуску мини-ПК Д14И на собственной плате «Ухта-3»
23.09.2026
Elsevier и LG AI Research интегрируют специфические для химии технологии искусственного интеллекта в свои исследования.
23.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
