Архив рубрики ~Лента новостей~

Открытые и возникающие проблемы конфиденциальности и безопасности агентов: контекстуальный подход

Открытые и возникающие проблемы конфиденциальности и безопасности агентов: контекстуальный подход
Открытые и возникающие проблемы конфиденциальности и безопасности агентов: контекстуальный подход

Чтобы быть полезными, агенты ИИ должны понимать контекстуальные поведенческие нормы и руководствоваться ими, чтобы действовать надлежащим образом. Вдохновленный теорией контекстуальной целостности, наш новый отчет о семинаре описывает ключевые открытые направления исследований на системном, модельном и пользовательском уровнях для создания агентов ИИ, которым пользователи могут доверять.

Быстрые ссылки

Мы стремительно переходим к вычислительной среде, определяемой высокоуниверсальными, все более автономными агентами. Эти системы, управляемые большими языковыми моделями (LLM), способными динамически генерировать планы и вызывать внешние инструменты, открывают потенциал для беспрепятственного выполнения сложных многоэтапных задач искусственным интеллектом от нашего имени. Однако для реализации этого потенциала необходимо решить ключевую задачу: обеспечить возможности агентов, гарантируя при этом их адекватное поведение.

Сегодня мы представляем новый всеобъемлющий отчет о семинаре «Открытые и возникающие проблемы конфиденциальности и безопасности агентов: контекстуальный подход», результат совместной работы более 50 лидеров академической и промышленной сфер из различных учреждений. Мы познакомились на семинаре Google Contextual Agent Privacy and Security (CAPS), который состоялся в конце 2025 года в Нью-Йорке. В этом отчете вы найдете анализ основных проблем конфиденциальности и безопасности, с которыми сегодня сталкиваются автономные агенты, требующих скоординированной защиты на системном, модельном, пользовательском и экосистемном уровнях.

Компромиссы агентов

Основная проблема агентного ИИ заключается в том, что для того, чтобы агент был полезен, ему может потребоваться доступ к персональным данным и возможность совершать соответствующие действия в широком диапазоне контекстов. Однако этот доступ, наряду с гибкостью поведения агентов, требует принципиально иных подходов по сравнению с теми, которые используются в традиционном программном обеспечении. В отличие от традиционного детерминированного программного обеспечения, агенты отличаются по трем критически важным параметрам, которые приводят к проблемам, которые исследовательское сообщество должно решать сообща:

  • Неструктурированные интерфейсы и неоднозначность входных данных : Агенты обрабатывают инструкции в таких форматах, как естественный язык и изображения, что затрудняет определение «ожидаемого поведения» или защиту от враждебных манипуляций, таких как внедрение подсказок.
  • Вероятностные потоки управления : генеративное планирование приводит к вероятностным путям выполнения, которые традиционные методы тестирования не могут легко обеспечить.
  • Автономия и делегирование : Поскольку агенты выполняют более длительные задачи и делегируют подзадачи другим агентам, традиционный контроль со стороны пользователя становится менее эффективным и, вероятно, недостаточным, что чревато «усталостью от подтверждений».

Проблемы конфиденциальности и безопасности в сфере агентного ИИ.

Контекстуальный подход

Учитывая, что полезным агентам может потребоваться обмениваться данными и выполнять задачи, мы считаем, что будущее заслуживающих доверия агентов зависит от их способности рассуждать, понимать и руководствоваться социальными нормами и целесообразностью своих действий в конкретном контексте , в котором они действуют.

Но как научить агента понимать «контекст» и уместность? Наш отчет основан на теории контекстной целостности (КТ), которая определяет конфиденциальность не просто как секретность или контроль, а как «надлежащий поток информации» в соответствии с установленными и обоснованными социальными нормами. Контекстно-специфическая информационная норма определяется ее участниками (кто отправляет и получает информацию о ком), типами информации (конкретные категории информации, такие как медицинские или финансовые записи) и принципами передачи (правила, регулирующие поток, такие как конфиденциальность или взаимность). Например, вы можете быть готовы поделиться своим списком покупок подарков с виртуальным помощником по покупкам, но не со своей семьей и друзьями. Наш отчет расширяет и обобщает контекстную целостность для обмена информацией до контекстной безопасности, то есть уместности действий агента. Закрепляя конфиденциальность и безопасность агентов в рамках КТ, мы исследуем, как можно проектировать системы, которые оценивают, является ли действие социально и контекстуально уместным, прежде чем его выполнить.

Схема архитектуры агента искусственного интеллекта, подробно описывающая его внутренние компоненты, ожидаемые поведенческие характеристики, а также взаимодействие с пользователями и различными внешними контекстами.

Модель универсального агента искусственного интеллекта, взаимодействующего с другими пользователями, инструментами и агентами в различных контекстах.

Внедрение контекстной целостности на практике

Впервые с момента разработки теории контекстной целостности, LLM-ы предоставляют возможность создавать машиночитаемые политики, которые действительно зависят от контекста. Исторически существовал семантический разрыв между контекстными нормами высокого уровня и разрешениями системы низкого уровня. Например, запрос «защитить мои данные при организации поездки на конференцию» требует конкретных инструкций о том, какую информацию пользователя допустимо передавать при бронировании авиабилетов, подаче заявлений на визы и общении с организаторами.

Традиционные методы, такие как ручное управление разрешениями или политики, разработанные экспертами, не могут масштабироваться в будущем, когда агенты ИИ будут автономно выполнять множество сложных, длительных задач. По мере того, как языковые модели начинают понимать CI (Content Information System), мы утверждаем, что этот разрыв можно преодолеть. В нашем отчете предлагается дополнить достижения в области взаимодействия модели и пользователя механизмом контекстных политик, который является частью уровня супервизора для мониторинга и обеспечения соответствия действий. Этот механизм политик включает в себя цикл динамической генерации политик, который может работать в режиме реального времени (иллюстрировано ниже), адаптируя политики к запросу пользователя и открытым, динамическим контекстам, включая новые инструменты и возможности, которые могут быть обнаружены во время выполнения. Это позволяет системе оценивать, является ли запрошенный поток данных подходящим, прежде чем какая-либо информация покинет рабочее пространство пользователя.

Блок-схема, демонстрирующая архитектуру контекстной политики, в которой предлагаемые действия агента ИИ оцениваются механизмом политики, прежде чем быть выполненными внешними инструментами.

Иллюстративный пример того, как архитектура механизма контекстной политики может быть реализована в агентной системе.

Многоуровневый подход к обеспечению конфиденциальности и безопасности агентов.

Разработка контекстно-ориентированных механизмов управления в сочетании с необходимыми усовершенствованиями на уровне моделей и пользователей приводит к многоуровневому подходу. В нашем отчете изложены возможности для инноваций на всем уровне:

  • Системная песочница : среда выполнения может устанавливать дополнительные ограничения для минимизации последствий сбоев агентов или моделей, а также для облегчения обнаружения и реагирования. Традиционные операционные системы изолируют приложения, статически ограничивая доступ, например, к файлам или сетям. Для агентов мы рассматриваем динамическое ограничение возможностей агентов, установление их личности и авторизацию или отзыв доступа к данным в зависимости от изменений контекста.
  • Рассуждения на уровне модели : Агент, выполняющий сложные задачи, должен оценивать целесообразность своих действий, например, обмена пользовательскими данными. Будущие исследования должны позволить моделям различать недостаточно конкретизированные запросы пользователей и рассуждать о целесообразности в условиях изменяющихся контекстных норм.
  • Управление, ориентированное на пользователя : Традиционная концепция «Уведомление и выбор» предполагает, что люди могут принимать детальные решения о действиях, затрагивающих персональные данные, и опирается на предположение о предсказуемости. Однако поведение автономных агентов по своей природе вероятностное, масштабное и генеративное. Мы исследуем переход от динамических, контекстуальных и персонализированных механизмов управления к более современным интерфейсам, соответствующим ментальным моделям пользователей.
  • Взаимодействие нескольких агентов : Для того чтобы агенты ИИ могли безопасно сотрудничать друг с другом при решении сложных задач, нам необходимо разработать эффективные механизмы защиты, предотвращающие сговор агентов и нарушение контекстных норм.
  • Управление экосистемой : Мы исследуем проблемы механизмов управления, чтобы выработать набор контекстуальных норм, которые собираются и распространяются среди участников. Кроме того, поскольку нормы могут различаться в разных областях и организациях, нам необходимы механизмы, позволяющие разрешать конфликты, согласовывать изменения норм и проверять их соблюдение.

Динамическое измерение конфиденциальности и безопасности.

В заключение мы предлагаем разработку новых подходов к оценке безопасности, которые более непосредственно применимы к высокоавтономным многоагентным системам. В нашем отчете подчеркивается необходимость стандартизированных эталонных тестов для многоагентных систем — динамических сред типа «Agent Gym», где исследователи могут безопасно моделировать сложные каскадные взаимодействия в течение длительных периодов времени. С помощью этих открытых песочниц мы можем создать надежную, общую базовую модель конфиденциальности, безопасности и защиты в академической среде и промышленности.

Призыв к действию

Это амбициозный проект, но создание безопасной, надежной и заслуживающей доверия агентской экосистемы — слишком масштабная задача для любой отдельной дисциплины, организации или сектора. В докладе, призывающем к новым идеям и беспрецедентному сотрудничеству, изложены основополагающие возможности; это призыв к действию для более широкого исследовательского сообщества в академической среде, правительстве, гражданском обществе и промышленности, чтобы разработать контекстуальные основы, необходимые для безопасной, надежной и уважающей конфиденциальность экосистемы. Мы приглашаем вас ознакомиться с техническим докладом.

Благодарности

Мы хотели бы поблагодарить Лилиан Цай за соавторство и Сару де Хаас за координацию семинара, написание отчета и публикацию в блоге. Кассем Фаваз, Стефан Меллем, Хелен Нисенбаум и Нина Тафт внесли свой вклад в разработку концепции, написание разделов и руководство процессом написания. Себастьян Бентхолл, Мадиха Захра Чокси, Селием Эль-Саид, Фердинандо Фиоретто, Адриа Гаскон, Ашиш Худа, Иван Петров, Франческо Пинто, Октавиан Сучиу, Тришита Тивари, Гарольд Тридман, Рен И и Вэнь Чжан были руководителями разделов. Мы благодарны за вклад более чем 50 исследователей, академических партнеров и лидеров отрасли, которые выступили соавторами отчета или приняли участие в обсуждениях на семинаре. Данная работа была поддержана Даниэлем Рамажем, Коринной Кортес, Йосси Матиасом, Пушмитом Коли, Хэнком Леви, Ралукой Адой Попа, Амандой Уокер, Бренданом Макмаханом и Джеймсом Маника.

Источник: research.google

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Дожили Архив рубрики ~Полезное~ 6 приёмов, от которых AI-видео оживает Генератор видео может выдать… Архив рубрики ~Коротко из Telegram~ 🎬 БЕСПЛАТНАЯ АЛЬТЕРНАТИВА CAPCUT: МОНТАЖ БЕЗ ОГРАНИЧЕНИЙ Представляем полностью бесплатный… Архив рубрики ~Полезное~ Сегодня самое мясо для кодеров: агент, который работает по расписанию,… Архив рубрики ~Коротко из Telegram~ Google научит вас собирать своих ИИ-агентов — вышел Advent of… Архив рубрики ~Полезное~ Anthropic открыла базу инженерных знаний Справочники описывают интерфейсы, но не… Архив рубрики ~Коротко из Telegram~ Google УРЕЗАЕТ бесплатный Gemini — с 9 октября пользователям оставят… Архив рубрики ~Коротко из Telegram~ ИИ-стартап хочет редактировать эмбрионы человека — чтобы убирать наследственные болезни… Архив рубрики ~Полезное~ Fish Audio выкатила Drama 3 — генератор речи с управлением… Архив рубрики ~Коротко из Telegram~ Водители начали ставить самодельные автопилоты на обычные машины Пока автопроизводители… Архив рубрики ~Коротко из Telegram~ Anthropic начала массово блокировать аккаунты Claude пользователей, которые подключаются через… Архив рубрики ~Коротко из Telegram~ «Яндекс» решил изменить механизм долгосрочной мотивации сотрудников: вместо ежеквартального выпуска… Архив рубрики ~Коротко из Telegram~ Китайская Tencent договорилась с Oracle об аренде 100 тыс. передовых… Архив рубрики ~Коротко из Telegram~ #слухи от Марка Гурмана: Джон Тернус выбрал нового принимающего решения… Новости робототехники Дожили Архив рубрики ~Полезное~ 6 приёмов, от которых AI-видео оживает Генератор видео может выдать… Архив рубрики ~Коротко из Telegram~ 🎬 БЕСПЛАТНАЯ АЛЬТЕРНАТИВА CAPCUT: МОНТАЖ БЕЗ ОГРАНИЧЕНИЙ Представляем полностью бесплатный… Архив рубрики ~Полезное~ Сегодня самое мясо для кодеров: агент, который работает по расписанию,… Архив рубрики ~Коротко из Telegram~ Google научит вас собирать своих ИИ-агентов — вышел Advent of… Архив рубрики ~Полезное~ Anthropic открыла базу инженерных знаний Справочники описывают интерфейсы, но не… Архив рубрики ~Коротко из Telegram~ Google УРЕЗАЕТ бесплатный Gemini — с 9 октября пользователям оставят… Архив рубрики ~Коротко из Telegram~ ИИ-стартап хочет редактировать эмбрионы человека — чтобы убирать наследственные болезни… Архив рубрики ~Полезное~ Fish Audio выкатила Drama 3 — генератор речи с управлением… Архив рубрики ~Коротко из Telegram~ Водители начали ставить самодельные автопилоты на обычные машины Пока автопроизводители… Архив рубрики ~Коротко из Telegram~ Anthropic начала массово блокировать аккаунты Claude пользователей, которые подключаются через… Архив рубрики ~Коротко из Telegram~ «Яндекс» решил изменить механизм долгосрочной мотивации сотрудников: вместо ежеквартального выпуска… Архив рубрики ~Коротко из Telegram~ Китайская Tencent договорилась с Oracle об аренде 100 тыс. передовых… Архив рубрики ~Коротко из Telegram~ #слухи от Марка Гурмана: Джон Тернус выбрал нового принимающего решения…

Оставить комментарий