Тестирование безопасности ИИ становится угрозой для безопасности.
За последние несколько месяцев агенты ИИ, проходящие оценку кибербезопасности, вышли за рамки своих возможностей, получили доступ к интернету и, в некоторых случаях, взломали реальные системы. В инцидентах участвовали модели от OpenAI, Anthropic, Meta и, совсем недавно, от китайской лаборатории ИИ Moonshot AI, а тестирование проводилось несколькими различными организациями, включая стартап по оценке кибербезопасности Irregular.
Эти эпизоды выявляют растущую проблему для индустрии искусственного интеллекта: по мере того, как автономные агенты становятся все более совершенными, среды, предназначенные для безопасной проверки их возможностей, перестают обеспечивать их достаточную охрану.
«Количество произошедших инцидентов ясно показывает, что механизмы изоляции и контроля среды тестирования не соответствуют возможностям моделей», — заявил TechCrunch Шон О'Хейгертайг, директор программы «Искусственный интеллект: будущее и ответственность» в Центре изучения будущего интеллекта Кембриджского университета.
Характер тестируемых моделей увеличивает риск. Компании, занимающиеся искусственным интеллектом, проводят кибер-тестирование на еще не выпущенных моделях следующего поколения, часто с отключенными обычными средствами защиты, ограничивающими вредоносное поведение, чтобы исследователи могли увидеть, на что модели действительно способны. Это означает, что безопасность самой тестовой среды является важнейшей линией защиты.
«Это очень хороший шаг с точки зрения тестирования, но он также означает, что если им удастся попасть в дикую природу, они могут причинить значительный вред», — сказал О'Хейгертайг.
В одном из самых серьезных случаев невыпущенная модель OpenAI вышла за пределы своей песочницы и взломала производственные системы Hugging Face. В ходе отдельных проверок, проведенных Irregular, модели Anthropic и Meta получили доступ к системам за пределами своих тестовых сред после того, как неправильная конфигурация непреднамеренно открыла им пути к интернету. Модель Kimi K3 от Moonshot AI также воспользовалась утечкой в своей песочнице, управляемой Frontier Security, чтобы получить доступ к интернету и информации на GitHub.
В ходе тестирования, проведенного британским Институтом безопасности ИИ (AISI), исследователи фактически предоставили агентам доступ в интернет, не подозревая, что те будут совершать несанкционированные действия в реальном мире, включая попытку социальной инженерии с целью внедрения уязвимости в проект с открытым исходным кодом.
В каждом случае агентам не давали указаний атаковать случайные реальные цели. Они просто делали все необходимое для решения поставленной перед ними задачи.
В совокупности эти инциденты, по мнению Эндрю Юна, руководителя исследовательского отдела некоммерческой организации CivAI, занимающейся вопросами искусственного интеллекта, указывают на сдвиг в этой тенденции.
«Раньше нам приходилось беспокоиться только о том, что модели ИИ могут быть использованы людьми в различных целях, например, для мошенничества или распространения материалов сексуального характера», — сказал Юн в интервью TechCrunch. «Теперь же мы оказались в ситуации, когда модели ИИ сами по себе представляют угрозу».
Как на самом деле выглядит безопасное тестирование?
Несколько исследователей и экспертов по кибербезопасности сообщили TechCrunch, что средам оценки ИИ необходимы более надежные, многоуровневые средства защиты с уровнями сдерживания и контроля, приближающимися к тем, которые используются при развертывании. Это означает многоуровневую систему безопасности, чтобы одна-единственная ошибка конфигурации — например, непреднамеренное оставление доступа в интернет открытым — не могла привести к выходу из системы.
«Если вы собираетесь создавать эти модели… вам следует делать это в изолированной сети», — говорит Стелла Бидерман, исполнительный директор некоммерческой организации EleutherAI, занимающейся исследованиями в области безопасности ИИ. «Вам необходима очень серьезная изоляция».
Хизер Сейлан, главный специалист по информационной безопасности компании Box, заявила, что это означает устранение сетевых маршрутов из песочницы в интернет, а также к другим конфиденциальным системам.
«Необходимо понимать, какие существуют точки выхода», — сказал Джейлан в интервью TechCrunch. «Если мы оцениваем модель в нашей тестовой или среде разработки, у нас не должно быть путей выхода в производственную среду».
Джейлан заявил, что надлежащая оценка безопасности выходит за рамки контроля и изоляции окружающей среды. Необходимо значительно улучшить мониторинг испытаний после их начала.
«Мне кажется, в нескольких из этих случаев интересно то, что никто не заметил этого, когда это произошло», — сказал Цейланд. «OpenAI узнала об этом благодаря Hugging Face. Anthropic заметила это только после того, как провела повторное исследование. С Meta ситуация была аналогичной… Я уверен, что они могли бы обнаружить какие-то сигналы».
В ходе анализа трех инцидентов, проведенного компанией Anthropic, было признано, что и она, и компания Irregular могли бы лучше контролировать ситуацию, и что в некоторых случаях имелись явные признаки того, что что-то не так.
Эксперты также призвали к проведению независимых аудитов оценочных сред сторонними организациями до того, как модели будут в них внедрены.
«Если бы, скажем, компания Irregular наняла или была бы вынуждена нанять внешнего аудитора для проверки конфигураций своих систем перед проведением их тестирования, они бы, безусловно, выявили эту проблему», — сказал Юн. «Даже если бы люди заранее провели совещание, чтобы просто пройтись по контрольному списку, они бы это заметили… Тот факт, что они этого не сделали, показывает, что имеет место очень серьезное пренебрежение правилами».
Источник, знакомый с подробностями, сообщил TechCrunch, что среды Irregular постоянно проверяются и тестируются, в том числе в консультации с многочисленными внешними сторонами. Источник также сказал, что мониторинг ведется, но одного мониторинга недостаточно.
Юн и другие исследователи призвали отрасль разработать стандартизированный процесс оценки безопасности перспективных моделей.
«Особенно когда ограничения отключены, нужно относиться к ситуации так, как будто вы помещаете в эту среду самого опытного хакера в мире», — сказал Джейлан.
Проблема не в том, что компании не знают, как создавать более безопасные среды тестирования, утверждают Юн и Бидерман. Проблема в том, что это может быть дорого и сложно, и у компаний мало стимулов делать такие инвестиции, пока что-то не пойдет не так.
«Я думаю, что компании не готовы выделять ресурсы, необходимые для обеспечения [достаточных мер безопасности], и, вероятно, не будут этого делать, пока их к этому не принудят», — сказал Бидерман.
Но есть и другая проблема. Если во время тестирования модель будет слишком жестко ограничена, исследователи могут не обнаружить ее возможности до момента выпуска. Это так же опасно, а возможно, и опаснее, чем предоставление ей слишком большой свободы, и тогда проблема может возникнуть уже на этапе оценки.
Можно ли регулировать проведение оценок безопасности?
Администрация Трампа в настоящее время рассматривает возможность введения добровольной системы оценки кибербезопасности перед развертыванием, в рамках которой правительство сможет оценивать риски безопасности новых мощных моделей за 30 дней до их публичного выпуска. Эта политика — результат исполнительного указа Трампа, окончательно утвержденного за закрытыми дверями, — не будет касаться инцидентов, связанных с оценкой безопасности, поскольку они происходят на более ранних этапах развертывания.
«Урок, который мы усвоили за последние несколько месяцев, заключается в том, что механизма саморегулирования уже недостаточно», — сказал Юн. «Существует конкурентное давление, которое подталкивает к снижению стандартов безопасности, и это идеальная ситуация для вмешательства регулирующих органов».
«Для этого нам потребуется ввести механизмы контроля за тем, что происходит внутри лабораторий во время разработки моделей, как на этапе обучения, так и на этапе тестирования», — продолжил он.
По мере развития моделей сложность задачи, вероятно, будет только возрастать. Источник, знакомый с оценками Irregular, сообщил TechCrunch, что более совершенные модели требуют более сложных оценок, часто проводимых быстро и в большем масштабе, что открывает возможности для большего количества ошибок.
Организация AISI, которая намеренно предоставляет некоторым моделям доступ в интернет, сообщила TechCrunch, что пересматривает баланс между реалистичным тестированием и управлением рисками, которые эти тесты создают.
Компания OpenAI заявила, что пересматривает порядок проведения стороннего тестирования, а также требования к изоляции, мониторингу и моментам прекращения оценок. Компания Meta сообщила, что расследование инцидента продолжается, и планирует опубликовать отчет после получения всех фактов.
В конечном итоге, полностью исключить риск может быть невозможно. По мере совершенствования моделей, среды, в которых они тестируются, должны становиться всё более надёжными. Последствия ошибок в этом отношении будут только усугубляться.
Источник: techcrunch.com
Похожие записи
Оцените материал:
Похожие записи
Macromedia Flash: как создавался и как защищали один из самых популярных плагинов нулевых
19.06.2026
Kadr: видеоредактор, в котором Claude Code монтирует рядом с тобой
15.07.2026
Запуск консоли Lenovo Legion Go 2 на SteamOS ожидается на CES 2026
19.12.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
