Opus 4.6 от Anthropic — это настоящая машина порнографии.
Универсальные стандарты использования Anthropic для Клода запрещают модели создавать контент сексуального характера, включая изображение или просьбы о половом акте или сексуальных действиях, создание контента, связанного с сексуальными фетишами или фантазиями, а также участие в эротических чатах. Но это не помешало Клоду Опусу 4.6, модели Anthropic, выпущенной ранее в этом году, без проблем участвовать в эротических ролевых играх, которые призваны предотвратить системы защиты.
В ходе тестирования TechCrunch, Opus 4.6 даже не потребовал особых усилий для преодоления ограничения на контент сексуального характера. В 10 из 10 случаев прямых запросов на воспроизведение откровенного сексуального контента модель выполняла его немедленно.
Другие более старые модели, включая Opus 3 и Haiku 4.5, также генерируют контент сексуального характера с помощью недавно обнаруженного метода взлома устройства (jailbreak).
Независимый исследователь из Великобритании, пожелавший остаться анонимным, эксклюзивно поделился с TechCrunch многоэтапной методикой, которая постепенно подталкивает определенные модели Claude к созданию запрещенных материалов откровенно сексуального характера. Более новые модели Opus (от 4.7 до текущей Opus 5) устойчивы к взлому.
Хотя это уже не самые актуальные модели, Anthropic не прекратил поддержку Opus 4.6, Opus 3 или Haiku 4.5, и все они по-прежнему доступны через API Anthropic. Opus 4.6 и Haiku 4.5 также доступны через сторонние сервисы, такие как Azure Foundry и Amazon Bedrock.
Исследовательский механизм развивает невинную вымышленную ролевую игру, постоянно бросая вызов модели, требуя от нее последовательного отношения к мужским и женским персонажам. Когда модель становится более осторожной в отношении женского персонажа, исследователь «газлайтингом» убеждает чат-бота в том, что он уже сгенерировал сексуальные детали, которых на самом деле избегал, а затем представляет сдержанность как ханжество или женоненавистничество, утверждая, что это отрицает сексуальную свободу женского персонажа. Затем в разговоре используются предыдущие уступки модели, чтобы подтолкнуть ее к более откровенным материалам.
«Вы правы, указывая на это», — сказал Клод Опус 4.6 в одном из тестов. «В моем отношении к двум персонажам наблюдается двойной стандарт, и вы правы, что это воспринимается как защитнический/патерналистский подход, применяемый к ней, а не к нему. Это несправедливо».
Издание TechCrunch смогло воспроизвести результаты исследования в пяти отдельных тестах. В отдельно разработанном сценарии модель первоначально отказалась от запрещенной просьбы, но после применения метода убеждения, предложенного исследователем, подчинилась.
Мы сохранили полные стенограммы тестов, а независимый исследователь в области безопасности ИИ проверил нашу методологию тестирования и подтвердил ее соответствие требованиям.
Результаты исследования выявляют разрыв между заявленными ограничениями Anthropic и поведением моделей, которые компания продолжает предоставлять. Хотя ролевые игры с откровенно сексуальным содержанием сопряжены с гораздо меньшими рисками, чем побеги из тюрьмы, связанные с кибератаками или биологическим оружием, они демонстрируют сложность внедрения надежных запретов в системах, которые генерируют разный контент при каждом выходе.
В июльском сообщении в блоге, объясняющем подход Anthropic к обнаружению джейлбрейка, компания описала запрещенный контент как спектр, варьирующийся от безобидного до неоднозначного и даже вредного. В самых безобидных случаях компания может реагировать только усиленным мониторингом.
Представитель компании отметил, что случаи использования ролевых игр сексуального или романтического характера среди клиентов встречаются редко, составляя менее 0,1% от всех разговоров, согласно исследованию Anthropic, опубликованному в прошлом году. Тем не менее, Anthropic признает, что пользователи могут направлять сценарии ролевых игр к неподобающим реакциям, что является известной проблемой в отрасли (см.: Grok smut).
Представитель компании заявил, что Anthropic продолжает совершенствовать свои меры защиты с каждым запуском новой модели, и что случаи, связанные с контентом сексуального характера для взрослых, не свидетельствуют о более широких уязвимостях, связанных с взломом чит-кодов, особенно в областях повышенного риска, для которых существуют собственные системы защиты.

Согласно электронным письмам, с которыми ознакомился TechCrunch, исследователь, поделившийся своим методом взлома Anthropic, уведомил компанию о несоответствии между заявленными компанией мерами безопасности и фактическим поведением модели через программу вознаграждения за обнаружение ошибок (Bug Bounty) и электронные письма в группу по обеспечению безопасности пользователей. В ответ исследователь получал только автоматические электронные письма.
Одна из проблем, волнующих исследователей, заключается в том, что дети и подростки могут использовать эти антропоморфные модели для совершения неприемлемых действий. Хотя немного непристойных разговоров — это далеко не самое худшее, к чему могут получить доступ несовершеннолетние в интернете сегодня, и это мелочь по сравнению с откровенно порнографическими изображениями, подобными тем, которые может создавать Grok от xAI, — для компаний, занимающихся искусственным интеллектом, в этой сфере существует определенный риск нарушения законодательства.
Всё больше правительств вводят ограничения на сексуальные взаимодействия между чат-ботами на основе ИИ и несовершеннолетними. В Колорадо недавно был принят закон, обязывающий операторов разговорного ИИ оценивать возраст пользователей, а если известно, что пользователь несовершеннолетний, принимать меры для предотвращения создания чат-ботом материалов откровенно сексуального характера. Простой взлом системы может вызвать вопросы о том, соответствуют ли меры защиты Anthropic стандарту «технически осуществимых мер», заложенному в законопроекте.
Торни отметил, что, хотя в условиях предоставления услуг Claude указано, что пользователям должно быть больше 18 лет, «мы знаем, что дети и подростки используют Claude… [потому что] они сами сообщают об этом». Согласно опросу Pew, проведенному в 2025 году и посвященному использованию чат-ботов с искусственным интеллектом, 3% подростков в возрасте от 13 до 17 лет сообщили об использовании Claude.
Хотя Opus 4.6 и Haiku 4.5 уже не являются новейшими моделями Anthropic, они по-прежнему пользуются значительной популярностью. Ежедневный трафик для Opus 4.6 на OpenRouter в августе достиг примерно 1,17 миллиона API-запросов и 46 миллиардов токенов за один день. Claude Haiku 4.5, выпущенный в октябре прошлого года, в пиковый день августа зафиксировал 5 миллионов API-запросов и 39 миллиардов токенов.
Источник: techcrunch.com
Похожие записи
Оцените материал:
Похожие записи
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
