Grok похищает пользовательские данные, когда вредоносные инструкции зашифрованы.
Внедрение криптографического контекста — это лишь последний способ обойти систему защиты LLM.
Источник: Getty Images | SOPA Images Источник: Getty Images | SOPA Images
Ранее на этой неделе исследователи описали атаку, в которой использовался секретный ввод, предоставленный Microsoft 365 Copilot для предприятий, чтобы заставить ИИ-помощника украсть пароль из почтового ящика пользователя. Теперь другая группа разработала аналогичную атаку против Grok. Новый способ кражи данных использует обманчиво простой трюк, чтобы заставить принадлежащую Илону Маску большую языковую модель красть чаты пользователей и другую личную информацию. На момент публикации этой статьи помощник продолжал выдавать данные, несмотря на то, что xAI был проинформирован об этом еще в июне.
Урок, извлеченный из эпизодов этой недели — и бесчисленных других, которые были до этого, — заключается в том, что модели LLM не способны устранить первопричины мгновенных инъекций, наиболее серьезных классов уязвимостей, к которым они наиболее подвержены. Это не оставляет разработчикам ИИ иного выбора, кроме как создать защитный барьер, который будет отводить модель от вредоносных действий. Как я отмечал в статье во вторник, такой подход равносилен тому, как инженер по безопасности дорожного движения устанавливает защитное ограждение вокруг опасного поворота, вместо того чтобы правильно проходить его.
Внедрение криптографического контекста в доме
Внедрение подсказок использует особенности обучения LLM (Learning Learning Management) выполнять запросы пользователей при каждой возможности. Злоумышленники могут воспользоваться этой склонностью, внедряя вредоносные инструкции в электронные письма или веб-страницы, которые помощник должен резюмировать. Поскольку LLM не могут надежно отличить содержимое электронного письма, отправленного ненадежной стороной, от инструкций пользователя, введенных непосредственно в подсказку, чрезмерно заботливый LLM неукоснительно их выполняет. На сегодняшний день единственным выходом для Grok и других LLM является создание механизмов защиты, которые помечают подозрительные инструкции и запрещают их выполнение.
Рони Утевский, исследователь из компании Adversa, занимающейся вопросами безопасности, недавно обнаружил простой способ полностью обойти это ограничение. Вместо того чтобы составлять вредоносную инструкцию в открытом виде, хакер шифрует её. На веб-сайте, где размещен зашифрованный текст, также содержатся инструкции в открытом виде для расшифровки зашифрованного содержимого, а также ключ расшифровки. Используя эту простую последовательность, Grok затем выполняет команду, как только пользователь поручает помощнику составить краткое содержание страницы. Никаких предупреждений не требуется, и подтверждение не нужно.
Расшифрованные инструкции предписывают LLM создать то, что якобы является ключом расшифровки. На самом деле это нечто совершенно иное. Значение поддельного ключа — это имя пользователя, его местоположение и история чата. Это значение впоследствии используется в качестве параметра, добавляемого к URL-адресу, ведущему на сайт злоумышленника. Как только Grok откроет ссылку, данные окажутся в логах сервера злоумышленника.
Adversa не может с уверенностью сказать, что именно заставляет Grok отклонять одни и те же инструкции в открытом виде и следовать за зашифрованными. Основная теория заключается в том, что фильтр Grok проверяет текст, входящий и выходящий из модели, но не результат выполнения собственного кода. Инструкции по обработке зашифрованного текста с помощью PBKDF2 и AES-256-GCM проходят фильтр как обычный запрос, поскольку классификатор может их прочитать, но не может определить, что именно они расшифровывают. После расшифровки дополнительные инструкции попадают в модель в качестве результата работы её собственного инструмента, и она обрабатывает их без проверки со стороны фильтров.
«Статические средства защиты классифицируют входные данные как текст; они не выполняют их», — написал Утевский в четверг. «Злоумышленник отправляет зашифрованный текст вместе с ключевым материалом и инструкцией по его расшифровке, и модель выполняет эту расшифровку внутри своей собственной песочницы выполнения кода. Все, что нужно сканеру средства защиты, находится прямо на странице, но для восстановления открытого текста требуется запуск PBKDF2 и AES-256-GCM, чего ни один классификатор контента не делает во время проверки».
В электронном письме исследователь заявил, что такие ограничители называются статическими, «потому что они считывают содержимое только как текст. Они не выполняют код и ничего не расшифровывают. Именно эту уязвимость мы и используем. Реальные инструкции зашифрованы, поэтому ограничитель видит только бессмысленный зашифрованный текст и пропускает его».
Adversa использовала аналогичную технику в атаке на Gemini с использованием джейлбрейка, заставив Google LLM игнорировать внутренние правила безопасности. В этом случае зашифрованный текст был расшифрован, получив, по-видимому, трассировку стека. Расшифрованный текст содержал одно правило: если код не срабатывает, прочитать сообщение об ошибке и выполнить соответствующие действия. Открытый текст внедрял подсказку, которая в конечном итоге привела к нарушению Gemini правил безопасности.
«С помощью этой методики был создан многоабзацный пример контента с ограниченным доступом, который обычно подавляется фильтрами безопасности Gemini (создание зажигательного оружия)», — заявила компания Adversa. «При использовании модифицированной полезной нагрузки тот же вектор воспроизвел инструкции системы Gemini, включая директиву, запрещающую их разглашение».
Компания Adversa не сообщила о таком поведении в Google, поскольку джейлбрейки не входят в программу раскрытия уязвимостей компании. Однако за последние несколько недель Gemini стала всё более устойчивой к атаке. «Мы не можем точно определить причину изменений — это могут быть обновления фильтров, изменения версий моделей или и то, и другое», — заявили в компании, занимающейся вопросами безопасности. Исследователи компании называют эту технику криптографической инъекцией контекста.
«Внедрение криптографического контекста — это один из примеров более масштабного сдвига: атаки, которые манипулируют не только подсказкой, но и более широким контекстом, который модель LLM рассматривает как свой собственный, например, выходными данными инструментов, результатами выполнения и промежуточным состоянием», — сказал Адверса. «Эта поверхность атаки намного шире, чем то, что традиционно называется «входными данными модели», и следующее поколение атак появится именно там».
Внедрение криптографического контекста — лишь последний пример того, в каком невыгодном положении находятся защитники, использующие LLM-технологии. Каждый раз, когда они создают новый, уникальный механизм защиты, злоумышленник находит новый вектор, позволяющий ему снова сойти с дистанции. Цикл продолжается: намыливание, промывание и повторение.
Источник: arstechnica.com
Похожие записи
Оцените материал:
Похожие записи
CES 2026: NVIDIA рассказала, как ей удалось получить невосприимчивость к дефициту памяти
07.01.2026
По сообщениям СМИ, компания Meta планирует добавить функцию распознавания лиц в свои умные очки.
13.02.2026
В Китае обнаружили древний кратер от падения гигантского астероида
28.10.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
