Новый метод призван защитить детей от незаконного контента, созданного с помощью искусственного интеллекта.
Исследователи разработали методику аудита для проверки генеративных моделей ИИ на наличие вредоносных возможностей без запроса на получение незаконных результатов. Телефон: 617-253-2709 MIT News Office Подпись : Исследователи разработали процедуру оценки, которая проверяет генеративные модели ИИ на наличие вредоносных возможностей без генерации результатов. Это может позволить аудиторам выявлять модели с открытым исходным кодом, адаптированные для создания незаконного контента. Авторство : Кристин Данилофф, MIT; iStock Исследователи разработали процедуру оценки, которая проверяет генеративные модели ИИ на наличие вредоносных возможностей без генерации результатов. Это может позволить аудиторам выявлять модели с открытым исходным кодом, адаптированные для создания незаконного контента. Фото: Кристин Данилофф, MIT; iStock
В связи с резким ростом популярности генеративного искусственного интеллекта, в интернете появилось множество моделей с открытым исходным кодом, которые любой желающий может адаптировать для решения своей задачи, например, для создания рендеров продукции в определенном художественном стиле.
Однако эти модели также попадают в руки злоумышленников, которые могут оптимизировать их для создания незаконного контента, такого как разжигание ненависти или материалы, содержащие сексуальное насилие над детьми. Это растущая проблема — Национальный центр по розыску пропавших и эксплуатируемых детей получил более 1,5 миллиона сообщений о сгенерированных ИИ материалах, содержащих сексуальное насилие над детьми, в 2025 году, по сравнению с 67 000 в 2024 году.
Инженеры обычно проверяют ИИ на наличие вредоносных возможностей, задавая модели соответствующие запросы и анализируя ее результаты, но в случае с материалами сексуального характера, содержащими сексуальные домогательства, это невозможно, поскольку в США создание подобного контента является незаконным, независимо от намерений.
Чтобы избежать этой дилеммы и повысить безопасность ИИ, доцент Ашиа Уилсон и ее аспирант Винит Суриякумар объединились с исследователями из лаборатории Healthy ML Lab Массачусетского технологического института под руководством Марзие Гассеми и некоммерческой организацией Thorn, занимающейся защитой детей, чтобы разработать новый подход к аудиту, определяющий, может ли модель создавать материалы сексуального характера без соответствующего запроса. Thorn — это некоммерческая организация по защите детей, миссия которой — изменить подход к защите детей от сексуального насилия и эксплуатации в цифровую эпоху.
Их метод исследует, как были адаптированы внутренние механизмы модели, но никогда не генерирует результат. Изучая скрытые представления, он может с высокой степенью достоверности определить, была ли модель специализирована для создания вредоносных изображений.
В ходе тестирования процедура аудита выявила варианты моделей, специально разработанные для генерации CSAM со 100-процентной точностью. Хостинговая платформа может использовать этот метод для выявления небезопасных моделей и их быстрого удаления или предотвращения их загрузки.
«Это открывает новые возможности для платформ, размещающих модели с открытым исходным кодом, и для правоохранительных органов, позволяя им проверять, способна ли модель генерировать контент, связанный с сексуальным насилием над детьми. Раньше у нас не было способа это измерить. Это была огромная «слепая зона», которой некоторые пользовались. Теперь мы можем решить проблему безопасности ИИ, которая имеет серьезные негативные последствия», — говорит Винит Суриякумар, аспирант Массачусетского технологического института (MIT) по специальности «Электротехника и информатика» и ведущий автор статьи об этой методике.
В работе над статьей к Суриякамуру и Уилсону, профессору кафедры электротехники и информатики имени братьев Листер, ведущему исследователю Лаборатории информационных и управленческих систем (LIDS) и старшему автору, присоединились Лена Стемпфле, научный сотрудник Массачусетского технологического института; Гассеми, доцент кафедры электротехники и информатики и член Института медицинских инженерных наук (IMES) и LIDS; а также другие сотрудники Бостонского университета и компании Thorn. Статья была представлена в качестве тематического доклада на семинаре «Надежный ИИ во благо» в рамках Международной конференции по машинному обучению.
Адаптации аудита
Современные технологии упростили пользователям возможность специализации генеративной модели искусственного интеллекта под конкретные задачи посредством процесса, известного как тонкая настройка.
Вместо того чтобы переобучать всю модель на наборе данных, специфичном для конкретной задачи, можно использовать алгоритм, называемый адаптацией низкого ранга (LoRA), для более эффективной специализации модели.
Это привело к появлению множества новых вариантов генеративных моделей ИИ для различных целей, например, для создания акварельных изображений, имитирующих определённое художественное направление. Но это также позволило злоумышленникам создавать модели, способные генерировать высококачественные материалы сексуального характера и другие вредоносные изображения.
Для проверки модели инженеры обычно запрашивают у нее вредоносный контент и проверяют ее результаты, но эта процедура ручной проверки не масштабируема. Кроме того, многократное создание отвратительных изображений может оказывать негативное психологическое воздействие на экспертов-оценщиков.
Этот метод оценки быстро дает сбой при проверке материалов сексуального характера, создание которых в любых целях является незаконным в США и многих других странах.
«Мы оказались в очень сложной ситуации, когда, исходя из самого закона, мы не можем использовать де-факто существующие методы оценки. Нам пришлось отказаться от всего имеющегося инструментария и применить другой подход», — говорит Суриякумар.
Узнав об этой загадке, исследователи объединили усилия с Торном, чтобы решить эту проблему.
Негенеративное решение
Вместо того чтобы сосредотачиваться на результатах, исследователи сосредоточились на изменениях, которые алгоритм LoRA вносит в процессе тонкой настройки.
Их методика исследует эти модификации, называемые адаптерами LoRA, чтобы определить, была ли модель специализирована для вредоносной функции, не генерируя при этом выходной сигнал.
Используя метод, называемый гауссовым зондированием, исследователи подают на вход модели набор случайных точек данных и анализируют, как она обрабатывает эти данные в своей многослойной внутренней структуре.
«Мы никогда не запускаем модель до конца и не задаем ей никаких команд, поэтому мы никогда не генерируем изображения», — объясняет Суриякумар.
Исследователи фиксируют эти изменения в нескольких временных точках внутри внутренней структуры модели и усредняют их, чтобы обобщить, как адаптер LoRA изменил вычислительные процессы модели. Они обнаружили, что эти изменения являются убедительным сигналом того, насколько специализированной была модель.
Они протестировали свой метод на различных вариантах трех типов моделей, сравнивая результаты с эталонными данными от адаптеров LoRA, известных тем, что генерируют контент, содержащий материалы сексуального характера, другие вредоносные изображения и безопасный контент.
Их метод показал стопроцентную точность в идентификации моделей, адаптированных для генерации CSAM.
«Существует огромный круг проблем, связанных с безопасностью детей при использовании ИИ, и это реальные проблемы, которые необходимо решить. Многим детям причиняют вред дипфейки, созданные с помощью ИИ. Мы показали, что гауссовское зондирование может быть очень полезным инструментом, и мы надеемся, что исследовательское сообщество действительно уделит больше внимания этой проблеме», — говорит Уилсон.
Важно отметить, что их методика масштабируема и относительно недорога в реализации. Поскольку каждый месяц в интернете публикуются тысячи вариантов моделей, масштабируемость имеет ключевое значение для того, чтобы помочь аудиторам устранять вредные адаптации до того, как они получат широкое распространение.
Гауссовское зондирование также более надежно, чем некоторые другие методы аудита, поскольку злоумышленнику потребуется тщательно изменить внутреннюю работу базовой модели, чтобы избежать обнаружения.
В будущем исследователи планируют оценить свою методику на большем количестве вариантов моделей и выяснить, может ли гауссовское зондирование выявлять вредоносные возможности базовых моделей до их адаптации.
«Теперь у нас есть технологический подход, позволяющий частично решить эту проблему. В это сотрудничество было вложено много усилий, что позволило нам справиться с действительно сложной проблемой, от которой страдают многие дети как в стране, так и во всем мире. Надеюсь, мы сможем оказать существенное влияние на эту область», — говорит Гассеми.
Данная работа частично финансировалась за счет исследовательской стипендии Bridgewater AIA Labs.
Источник: news.mit.edu
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
