Открытые и возникающие проблемы конфиденциальности и безопасности агентов: контекстуальный подход
Чтобы быть полезными, агенты ИИ должны понимать контекстуальные поведенческие нормы и руководствоваться ими, чтобы действовать надлежащим образом. Вдохновленный теорией контекстуальной целостности, наш новый отчет о семинаре описывает ключевые открытые направления исследований на системном, модельном и пользовательском уровнях для создания агентов ИИ, которым пользователи могут доверять.
Быстрые ссылки
- Технический отчет
- Делиться
- Скопировать ссылку ×
Мы стремительно переходим к вычислительной среде, определяемой высокоуниверсальными, все более автономными агентами. Эти системы, управляемые большими языковыми моделями (LLM), способными динамически генерировать планы и вызывать внешние инструменты, открывают потенциал для беспрепятственного выполнения сложных многоэтапных задач искусственным интеллектом от нашего имени. Однако для реализации этого потенциала необходимо решить ключевую задачу: обеспечить возможности агентов, гарантируя при этом их адекватное поведение.
Сегодня мы представляем новый всеобъемлющий отчет о семинаре «Открытые и возникающие проблемы конфиденциальности и безопасности агентов: контекстуальный подход», результат совместной работы более 50 лидеров академической и промышленной сфер из различных учреждений. Мы познакомились на семинаре Google Contextual Agent Privacy and Security (CAPS), который состоялся в конце 2025 года в Нью-Йорке. В этом отчете вы найдете анализ основных проблем конфиденциальности и безопасности, с которыми сегодня сталкиваются автономные агенты, требующих скоординированной защиты на системном, модельном, пользовательском и экосистемном уровнях.
Компромиссы агентов
Основная проблема агентного ИИ заключается в том, что для того, чтобы агент был полезен, ему может потребоваться доступ к персональным данным и возможность совершать соответствующие действия в широком диапазоне контекстов. Однако этот доступ, наряду с гибкостью поведения агентов, требует принципиально иных подходов по сравнению с теми, которые используются в традиционном программном обеспечении. В отличие от традиционного детерминированного программного обеспечения, агенты отличаются по трем критически важным параметрам, которые приводят к проблемам, которые исследовательское сообщество должно решать сообща:
- Неструктурированные интерфейсы и неоднозначность входных данных : Агенты обрабатывают инструкции в таких форматах, как естественный язык и изображения, что затрудняет определение «ожидаемого поведения» или защиту от враждебных манипуляций, таких как внедрение подсказок.
- Вероятностные потоки управления : генеративное планирование приводит к вероятностным путям выполнения, которые традиционные методы тестирования не могут легко обеспечить.
- Автономия и делегирование : Поскольку агенты выполняют более длительные задачи и делегируют подзадачи другим агентам, традиционный контроль со стороны пользователя становится менее эффективным и, вероятно, недостаточным, что чревато «усталостью от подтверждений».
Проблемы конфиденциальности и безопасности в сфере агентного ИИ.
Контекстуальный подход
Учитывая, что полезным агентам может потребоваться обмениваться данными и выполнять задачи, мы считаем, что будущее заслуживающих доверия агентов зависит от их способности рассуждать, понимать и руководствоваться социальными нормами и целесообразностью своих действий в конкретном контексте , в котором они действуют.
Но как научить агента понимать «контекст» и уместность? Наш отчет основан на теории контекстной целостности (КТ), которая определяет конфиденциальность не просто как секретность или контроль, а как «надлежащий поток информации» в соответствии с установленными и обоснованными социальными нормами. Контекстно-специфическая информационная норма определяется ее участниками (кто отправляет и получает информацию о ком), типами информации (конкретные категории информации, такие как медицинские или финансовые записи) и принципами передачи (правила, регулирующие поток, такие как конфиденциальность или взаимность). Например, вы можете быть готовы поделиться своим списком покупок подарков с виртуальным помощником по покупкам, но не со своей семьей и друзьями. Наш отчет расширяет и обобщает контекстную целостность для обмена информацией до контекстной безопасности, то есть уместности действий агента. Закрепляя конфиденциальность и безопасность агентов в рамках КТ, мы исследуем, как можно проектировать системы, которые оценивают, является ли действие социально и контекстуально уместным, прежде чем его выполнить.
Модель универсального агента искусственного интеллекта, взаимодействующего с другими пользователями, инструментами и агентами в различных контекстах.
Внедрение контекстной целостности на практике
Впервые с момента разработки теории контекстной целостности, LLM-ы предоставляют возможность создавать машиночитаемые политики, которые действительно зависят от контекста. Исторически существовал семантический разрыв между контекстными нормами высокого уровня и разрешениями системы низкого уровня. Например, запрос «защитить мои данные при организации поездки на конференцию» требует конкретных инструкций о том, какую информацию пользователя допустимо передавать при бронировании авиабилетов, подаче заявлений на визы и общении с организаторами.
Традиционные методы, такие как ручное управление разрешениями или политики, разработанные экспертами, не могут масштабироваться в будущем, когда агенты ИИ будут автономно выполнять множество сложных, длительных задач. По мере того, как языковые модели начинают понимать CI (Content Information System), мы утверждаем, что этот разрыв можно преодолеть. В нашем отчете предлагается дополнить достижения в области взаимодействия модели и пользователя механизмом контекстных политик, который является частью уровня супервизора для мониторинга и обеспечения соответствия действий. Этот механизм политик включает в себя цикл динамической генерации политик, который может работать в режиме реального времени (иллюстрировано ниже), адаптируя политики к запросу пользователя и открытым, динамическим контекстам, включая новые инструменты и возможности, которые могут быть обнаружены во время выполнения. Это позволяет системе оценивать, является ли запрошенный поток данных подходящим, прежде чем какая-либо информация покинет рабочее пространство пользователя.
Иллюстративный пример того, как архитектура механизма контекстной политики может быть реализована в агентной системе.
Многоуровневый подход к обеспечению конфиденциальности и безопасности агентов.
Разработка контекстно-ориентированных механизмов управления в сочетании с необходимыми усовершенствованиями на уровне моделей и пользователей приводит к многоуровневому подходу. В нашем отчете изложены возможности для инноваций на всем уровне:
- Системная песочница : среда выполнения может устанавливать дополнительные ограничения для минимизации последствий сбоев агентов или моделей, а также для облегчения обнаружения и реагирования. Традиционные операционные системы изолируют приложения, статически ограничивая доступ, например, к файлам или сетям. Для агентов мы рассматриваем динамическое ограничение возможностей агентов, установление их личности и авторизацию или отзыв доступа к данным в зависимости от изменений контекста.
- Рассуждения на уровне модели : Агент, выполняющий сложные задачи, должен оценивать целесообразность своих действий, например, обмена пользовательскими данными. Будущие исследования должны позволить моделям различать недостаточно конкретизированные запросы пользователей и рассуждать о целесообразности в условиях изменяющихся контекстных норм.
- Управление, ориентированное на пользователя : Традиционная концепция «Уведомление и выбор» предполагает, что люди могут принимать детальные решения о действиях, затрагивающих персональные данные, и опирается на предположение о предсказуемости. Однако поведение автономных агентов по своей природе вероятностное, масштабное и генеративное. Мы исследуем переход от динамических, контекстуальных и персонализированных механизмов управления к более современным интерфейсам, соответствующим ментальным моделям пользователей.
- Взаимодействие нескольких агентов : Для того чтобы агенты ИИ могли безопасно сотрудничать друг с другом при решении сложных задач, нам необходимо разработать эффективные механизмы защиты, предотвращающие сговор агентов и нарушение контекстных норм.
- Управление экосистемой : Мы исследуем проблемы механизмов управления, чтобы выработать набор контекстуальных норм, которые собираются и распространяются среди участников. Кроме того, поскольку нормы могут различаться в разных областях и организациях, нам необходимы механизмы, позволяющие разрешать конфликты, согласовывать изменения норм и проверять их соблюдение.
Динамическое измерение конфиденциальности и безопасности.
В заключение мы предлагаем разработку новых подходов к оценке безопасности, которые более непосредственно применимы к высокоавтономным многоагентным системам. В нашем отчете подчеркивается необходимость стандартизированных эталонных тестов для многоагентных систем — динамических сред типа «Agent Gym», где исследователи могут безопасно моделировать сложные каскадные взаимодействия в течение длительных периодов времени. С помощью этих открытых песочниц мы можем создать надежную, общую базовую модель конфиденциальности, безопасности и защиты в академической среде и промышленности.
Призыв к действию
Это амбициозный проект, но создание безопасной, надежной и заслуживающей доверия агентской экосистемы — слишком масштабная задача для любой отдельной дисциплины, организации или сектора. В докладе, призывающем к новым идеям и беспрецедентному сотрудничеству, изложены основополагающие возможности; это призыв к действию для более широкого исследовательского сообщества в академической среде, правительстве, гражданском обществе и промышленности, чтобы разработать контекстуальные основы, необходимые для безопасной, надежной и уважающей конфиденциальность экосистемы. Мы приглашаем вас ознакомиться с техническим докладом.
Благодарности
Мы хотели бы поблагодарить Лилиан Цай за соавторство и Сару де Хаас за координацию семинара, написание отчета и публикацию в блоге. Кассем Фаваз, Стефан Меллем, Хелен Нисенбаум и Нина Тафт внесли свой вклад в разработку концепции, написание разделов и руководство процессом написания. Себастьян Бентхолл, Мадиха Захра Чокси, Селием Эль-Саид, Фердинандо Фиоретто, Адриа Гаскон, Ашиш Худа, Иван Петров, Франческо Пинто, Октавиан Сучиу, Тришита Тивари, Гарольд Тридман, Рен И и Вэнь Чжан были руководителями разделов. Мы благодарны за вклад более чем 50 исследователей, академических партнеров и лидеров отрасли, которые выступили соавторами отчета или приняли участие в обсуждениях на семинаре. Данная работа была поддержана Даниэлем Рамажем, Коринной Кортес, Йосси Матиасом, Пушмитом Коли, Хэнком Леви, Ралукой Адой Попа, Амандой Уокер, Бренданом Макмаханом и Джеймсом Маника.
Источник: research.google
Похожие записи
- Google приостановил свою программу вознаграждения за обнаружение уязвимостей в открытом исходном коде из-за «значительного роста» числа сообщений об ошибках в сфере искусственного интеллекта.
- Google научит вас собирать своих ИИ-агентов — вышел Advent of…
- Google УРЕЗАЕТ бесплатный Gemini — с 9 октября пользователям оставят…
Оцените материал:
Похожие записи
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
