ToolHazard-Bench: как проверяют ИИ-агентов на устойчивость к prompt injection Как…
ToolHazard-Bench: как проверяют ИИ-агентов на устойчивость к prompt injection
Как только агент получает доступ к внешним инструментам — почте, поиску, веб-страницам — появляется классическая дыра: во входящих данных может быть спрятана инструкция для самой модели. Проект ToolHazard автоматизирует поиск таких уязвимостей вместо ручного придумывания атак.
Устроен он из трёх частей. Environment Simulator собирает исполняемые окружения, в которых агент реально работает с инструментами. Attacker Agent ищет точки внедрения и генерирует полезную нагрузку. User Simulator формирует длинные многошаговые задания, привязанные к текущему состоянию среды, — то есть проверка идёт не на одном сообщении, а на цепочке действий.
Из результатов: место и момент атаки заметно влияют на её успешность — одна и та же инъекция срабатывает по-разному в зависимости от того, на каком шаге агент её встретил. Данные, собранные бенчмарком, использовали для alignment-тюнинга, и защищённость выросла как на самом ToolHazard-Bench, так и на независимом AgentDojo, причём качество на обычных задачах не просело.
Похожие записи
Оцените материал:
Похожие записи
Кажется, мышки скоро станут не нужны. Augmental выпустила MouthPad — умную капу с…
27.07.2026
Гибернация в Windows съедает до 30 ГБ — и большинству…
17.12.2025
В свежем выпуске подкаста Сэм разговаривает с Девом Ришем, GM…
14.07.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
