ToolHazard-Bench: как проверяют ИИ-агентов на устойчивость к prompt injection Как…
ToolHazard-Bench: как проверяют ИИ-агентов на устойчивость к prompt injection
Как только агент получает доступ к внешним инструментам — почте, поиску, веб-страницам — появляется классическая дыра: во входящих данных может быть спрятана инструкция для самой модели. Проект ToolHazard автоматизирует поиск таких уязвимостей вместо ручного придумывания атак.
Устроен он из трёх частей. Environment Simulator собирает исполняемые окружения, в которых агент реально работает с инструментами. Attacker Agent ищет точки внедрения и генерирует полезную нагрузку. User Simulator формирует длинные многошаговые задания, привязанные к текущему состоянию среды, — то есть проверка идёт не на одном сообщении, а на цепочке действий.
Из результатов: место и момент атаки заметно влияют на её успешность — одна и та же инъекция срабатывает по-разному в зависимости от того, на каком шаге агент её встретил. Данные, собранные бенчмарком, использовали для alignment-тюнинга, и защищённость выросла как на самом ToolHazard-Bench, так и на независимом AgentDojo, причём качество на обычных задачах не просело.
Похожие записи
Оцените материал:
Похожие записи
Скилл для тех, кто не хочет читать ИИ-простыни Появился скилл…
24.07.2026
Кнопочные Nokia теперь с ИИ. HMD выпустила Nokia 200 4G:…
05.07.2026
OpenAI хочет процент с чужих открытий Финансовый директор OpenAI Сара…
31.01.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
