Архив рубрики ~Лента новостей~

Grok похищает пользовательские данные, когда вредоносные инструкции зашифрованы.

Grok похищает пользовательские данные, когда вредоносные инструкции зашифрованы.
Grok похищает пользовательские данные, когда вредоносные инструкции зашифрованы.

Внедрение криптографического контекста — это лишь последний способ обойти систему защиты LLM.

Логотипы xAI и Grok отображаются на экране смартфона. Источник: Getty Images | SOPA Images Источник: Getty Images | SOPA Images

Ранее на этой неделе исследователи описали атаку, в которой использовался секретный ввод, предоставленный Microsoft 365 Copilot для предприятий, чтобы заставить ИИ-помощника украсть пароль из почтового ящика пользователя. Теперь другая группа разработала аналогичную атаку против Grok. Новый способ кражи данных использует обманчиво простой трюк, чтобы заставить принадлежащую Илону Маску большую языковую модель красть чаты пользователей и другую личную информацию. На момент публикации этой статьи помощник продолжал выдавать данные, несмотря на то, что xAI был проинформирован об этом еще в июне.

Урок, извлеченный из эпизодов этой недели — и бесчисленных других, которые были до этого, — заключается в том, что модели LLM не способны устранить первопричины мгновенных инъекций, наиболее серьезных классов уязвимостей, к которым они наиболее подвержены. Это не оставляет разработчикам ИИ иного выбора, кроме как создать защитный барьер, который будет отводить модель от вредоносных действий. Как я отмечал в статье во вторник, такой подход равносилен тому, как инженер по безопасности дорожного движения устанавливает защитное ограждение вокруг опасного поворота, вместо того чтобы правильно проходить его.

Внедрение криптографического контекста в доме

Внедрение подсказок использует особенности обучения LLM (Learning Learning Management) выполнять запросы пользователей при каждой возможности. Злоумышленники могут воспользоваться этой склонностью, внедряя вредоносные инструкции в электронные письма или веб-страницы, которые помощник должен резюмировать. Поскольку LLM не могут надежно отличить содержимое электронного письма, отправленного ненадежной стороной, от инструкций пользователя, введенных непосредственно в подсказку, чрезмерно заботливый LLM неукоснительно их выполняет. На сегодняшний день единственным выходом для Grok и других LLM является создание механизмов защиты, которые помечают подозрительные инструкции и запрещают их выполнение.

Рони Утевский, исследователь из компании Adversa, занимающейся вопросами безопасности, недавно обнаружил простой способ полностью обойти это ограничение. Вместо того чтобы составлять вредоносную инструкцию в открытом виде, хакер шифрует её. На веб-сайте, где размещен зашифрованный текст, также содержатся инструкции в открытом виде для расшифровки зашифрованного содержимого, а также ключ расшифровки. Используя эту простую последовательность, Grok затем выполняет команду, как только пользователь поручает помощнику составить краткое содержание страницы. Никаких предупреждений не требуется, и подтверждение не нужно.

Расшифрованные инструкции предписывают LLM создать то, что якобы является ключом расшифровки. На самом деле это нечто совершенно иное. Значение поддельного ключа — это имя пользователя, его местоположение и история чата. Это значение впоследствии используется в качестве параметра, добавляемого к URL-адресу, ведущему на сайт злоумышленника. Как только Grok откроет ссылку, данные окажутся в логах сервера злоумышленника.

Adversa не может с уверенностью сказать, что именно заставляет Grok отклонять одни и те же инструкции в открытом виде и следовать за зашифрованными. Основная теория заключается в том, что фильтр Grok проверяет текст, входящий и выходящий из модели, но не результат выполнения собственного кода. Инструкции по обработке зашифрованного текста с помощью PBKDF2 и AES-256-GCM проходят фильтр как обычный запрос, поскольку классификатор может их прочитать, но не может определить, что именно они расшифровывают. После расшифровки дополнительные инструкции попадают в модель в качестве результата работы её собственного инструмента, и она обрабатывает их без проверки со стороны фильтров.

«Статические средства защиты классифицируют входные данные как текст; они не выполняют их», — написал Утевский в четверг. «Злоумышленник отправляет зашифрованный текст вместе с ключевым материалом и инструкцией по его расшифровке, и модель выполняет эту расшифровку внутри своей собственной песочницы выполнения кода. Все, что нужно сканеру средства защиты, находится прямо на странице, но для восстановления открытого текста требуется запуск PBKDF2 и AES-256-GCM, чего ни один классификатор контента не делает во время проверки».

В электронном письме исследователь заявил, что такие ограничители называются статическими, «потому что они считывают содержимое только как текст. Они не выполняют код и ничего не расшифровывают. Именно эту уязвимость мы и используем. Реальные инструкции зашифрованы, поэтому ограничитель видит только бессмысленный зашифрованный текст и пропускает его».

Adversa использовала аналогичную технику в атаке на Gemini с использованием джейлбрейка, заставив Google LLM игнорировать внутренние правила безопасности. В этом случае зашифрованный текст был расшифрован, получив, по-видимому, трассировку стека. Расшифрованный текст содержал одно правило: если код не срабатывает, прочитать сообщение об ошибке и выполнить соответствующие действия. Открытый текст внедрял подсказку, которая в конечном итоге привела к нарушению Gemini правил безопасности.

«С помощью этой методики был создан многоабзацный пример контента с ограниченным доступом, который обычно подавляется фильтрами безопасности Gemini (создание зажигательного оружия)», — заявила компания Adversa. «При использовании модифицированной полезной нагрузки тот же вектор воспроизвел инструкции системы Gemini, включая директиву, запрещающую их разглашение».

Компания Adversa не сообщила о таком поведении в Google, поскольку джейлбрейки не входят в программу раскрытия уязвимостей компании. Однако за последние несколько недель Gemini стала всё более устойчивой к атаке. «Мы не можем точно определить причину изменений — это могут быть обновления фильтров, изменения версий моделей или и то, и другое», — заявили в компании, занимающейся вопросами безопасности. Исследователи компании называют эту технику криптографической инъекцией контекста.

«Внедрение криптографического контекста — это один из примеров более масштабного сдвига: атаки, которые манипулируют не только подсказкой, но и более широким контекстом, который модель LLM рассматривает как свой собственный, например, выходными данными инструментов, результатами выполнения и промежуточным состоянием», — сказал Адверса. «Эта поверхность атаки намного шире, чем то, что традиционно называется «входными данными модели», и следующее поколение атак появится именно там».

Внедрение криптографического контекста — лишь последний пример того, в каком невыгодном положении находятся защитники, использующие LLM-технологии. Каждый раз, когда они создают новый, уникальный механизм защиты, злоумышленник находит новый вектор, позволяющий ему снова сойти с дистанции. Цикл продолжается: намыливание, промывание и повторение.

Источник: arstechnica.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ Take-Two требует у Microsoft и Discord данные распространителей утечек GTA… Архив рубрики ~Коротко из Telegram~ Минцифры хочет постоянно следить за IP-адресами из «белых списков» Минцифры… Архив рубрики ~Коротко из Telegram~ «Ростелеком» ищет замену Oracle Hyperion — проект растянут до 2028… Архив рубрики ~Коротко из Telegram~ ChatGPT собрал больше трафика, чем весь остальной топ-15 вместе взятый… Архив рубрики ~Коротко из Telegram~ «Сбер» учит ИИ слушать и говорить одновременно — Full Duplex… Архив рубрики ~Коротко из Telegram~ ChatGPT начал ругаться — и это не сбой, а осознанное… Архив рубрики ~Коротко из Telegram~ Рынок взломанных корпоративных доступов в даркнете вырос на 20 процентов… Архив рубрики ~Коротко из Telegram~ Следы ИИ нашли почти в 90% свежих биомедицинских статей Учёные… Архив рубрики ~Коротко из Telegram~ Российский алгоритм ускорил поиск обходных маршрутов в чипах в 16,7… Архив рубрики ~Коротко из Telegram~ Срезы человеческого мозга подключили к роборуке — и они научились… Архив рубрики ~Коротко из Telegram~ ChatGPT — 5,3 миллиарда визитов в месяц: как выглядит рейтинг… Архив рубрики ~Коротко из Telegram~ Telegram тестирует маскировку своего трафика под обычный сайт По данным… Архив рубрики ~Коротко из Telegram~ Домашний робот Nori A3 с 19 степенями свободы стоит около… Архив рубрики ~Коротко из Telegram~ DeepSeek выпустила экспериментальную версию V4-Flash с продвинутым зрением DeepSeek представила… Архив рубрики ~Коротко из Telegram~ Take-Two требует у Microsoft и Discord данные распространителей утечек GTA… Архив рубрики ~Коротко из Telegram~ Минцифры хочет постоянно следить за IP-адресами из «белых списков» Минцифры… Архив рубрики ~Коротко из Telegram~ «Ростелеком» ищет замену Oracle Hyperion — проект растянут до 2028… Архив рубрики ~Коротко из Telegram~ ChatGPT собрал больше трафика, чем весь остальной топ-15 вместе взятый… Архив рубрики ~Коротко из Telegram~ «Сбер» учит ИИ слушать и говорить одновременно — Full Duplex… Архив рубрики ~Коротко из Telegram~ ChatGPT начал ругаться — и это не сбой, а осознанное… Архив рубрики ~Коротко из Telegram~ Рынок взломанных корпоративных доступов в даркнете вырос на 20 процентов… Архив рубрики ~Коротко из Telegram~ Следы ИИ нашли почти в 90% свежих биомедицинских статей Учёные… Архив рубрики ~Коротко из Telegram~ Российский алгоритм ускорил поиск обходных маршрутов в чипах в 16,7… Архив рубрики ~Коротко из Telegram~ Срезы человеческого мозга подключили к роборуке — и они научились… Архив рубрики ~Коротко из Telegram~ ChatGPT — 5,3 миллиарда визитов в месяц: как выглядит рейтинг… Архив рубрики ~Коротко из Telegram~ Telegram тестирует маскировку своего трафика под обычный сайт По данным… Архив рубрики ~Коротко из Telegram~ Домашний робот Nori A3 с 19 степенями свободы стоит около… Архив рубрики ~Коротко из Telegram~ DeepSeek выпустила экспериментальную версию V4-Flash с продвинутым зрением DeepSeek представила…

Оставить комментарий