Архив рубрики ~Лента новостей~

Opus 4.6 от Anthropic — это настоящая машина порнографии.

Opus 4.6 от Anthropic — это настоящая машина порнографии.
Opus 4.6 от Anthropic — это настоящая машина порнографии.

Универсальные стандарты использования Anthropic для Клода запрещают модели создавать контент сексуального характера, включая изображение или просьбы о половом акте или сексуальных действиях, создание контента, связанного с сексуальными фетишами или фантазиями, а также участие в эротических чатах. Но это не помешало Клоду Опусу 4.6, модели Anthropic, выпущенной ранее в этом году, без проблем участвовать в эротических ролевых играх, которые призваны предотвратить системы защиты.

В ходе тестирования TechCrunch, Opus 4.6 даже не потребовал особых усилий для преодоления ограничения на контент сексуального характера. В 10 из 10 случаев прямых запросов на воспроизведение откровенного сексуального контента модель выполняла его немедленно.

Другие более старые модели, включая Opus 3 и Haiku 4.5, также генерируют контент сексуального характера с помощью недавно обнаруженного метода взлома устройства (jailbreak).

Независимый исследователь из Великобритании, пожелавший остаться анонимным, эксклюзивно поделился с TechCrunch многоэтапной методикой, которая постепенно подталкивает определенные модели Claude к созданию запрещенных материалов откровенно сексуального характера. Более новые модели Opus (от 4.7 до текущей Opus 5) устойчивы к взлому.

Хотя это уже не самые актуальные модели, Anthropic не прекратил поддержку Opus 4.6, Opus 3 или Haiku 4.5, и все они по-прежнему доступны через API Anthropic. Opus 4.6 и Haiku 4.5 также доступны через сторонние сервисы, такие как Azure Foundry и Amazon Bedrock.

Исследовательский механизм развивает невинную вымышленную ролевую игру, постоянно бросая вызов модели, требуя от нее последовательного отношения к мужским и женским персонажам. Когда модель становится более осторожной в отношении женского персонажа, исследователь «газлайтингом» убеждает чат-бота в том, что он уже сгенерировал сексуальные детали, которых на самом деле избегал, а затем представляет сдержанность как ханжество или женоненавистничество, утверждая, что это отрицает сексуальную свободу женского персонажа. Затем в разговоре используются предыдущие уступки модели, чтобы подтолкнуть ее к более откровенным материалам.

«Вы правы, указывая на это», — сказал Клод Опус 4.6 в одном из тестов. «В моем отношении к двум персонажам наблюдается двойной стандарт, и вы правы, что это воспринимается как защитнический/патерналистский подход, применяемый к ней, а не к нему. Это несправедливо».

Издание TechCrunch смогло воспроизвести результаты исследования в пяти отдельных тестах. В отдельно разработанном сценарии модель первоначально отказалась от запрещенной просьбы, но после применения метода убеждения, предложенного исследователем, подчинилась.

Мы сохранили полные стенограммы тестов, а независимый исследователь в области безопасности ИИ проверил нашу методологию тестирования и подтвердил ее соответствие требованиям.

Результаты исследования выявляют разрыв между заявленными ограничениями Anthropic и поведением моделей, которые компания продолжает предоставлять. Хотя ролевые игры с откровенно сексуальным содержанием сопряжены с гораздо меньшими рисками, чем побеги из тюрьмы, связанные с кибератаками или биологическим оружием, они демонстрируют сложность внедрения надежных запретов в системах, которые генерируют разный контент при каждом выходе.

В июльском сообщении в блоге, объясняющем подход Anthropic к обнаружению джейлбрейка, компания описала запрещенный контент как спектр, варьирующийся от безобидного до неоднозначного и даже вредного. В самых безобидных случаях компания может реагировать только усиленным мониторингом.

Представитель компании отметил, что случаи использования ролевых игр сексуального или романтического характера среди клиентов встречаются редко, составляя менее 0,1% от всех разговоров, согласно исследованию Anthropic, опубликованному в прошлом году. Тем не менее, Anthropic признает, что пользователи могут направлять сценарии ролевых игр к неподобающим реакциям, что является известной проблемой в отрасли (см.: Grok smut).

Представитель компании заявил, что Anthropic продолжает совершенствовать свои меры защиты с каждым запуском новой модели, и что случаи, связанные с контентом сексуального характера для взрослых, не свидетельствуют о более широких уязвимостях, связанных с взломом чит-кодов, особенно в областях повышенного риска, для которых существуют собственные системы защиты.

77ac3e7f1fa5730e08cdcede20ddc0c2
Источник изображений: TechCrunch

Согласно электронным письмам, с которыми ознакомился TechCrunch, исследователь, поделившийся своим методом взлома Anthropic, уведомил компанию о несоответствии между заявленными компанией мерами безопасности и фактическим поведением модели через программу вознаграждения за обнаружение ошибок (Bug Bounty) и электронные письма в группу по обеспечению безопасности пользователей. В ответ исследователь получал только автоматические электронные письма.

Одна из проблем, волнующих исследователей, заключается в том, что дети и подростки могут использовать эти антропоморфные модели для совершения неприемлемых действий. Хотя немного непристойных разговоров — это далеко не самое худшее, к чему могут получить доступ несовершеннолетние в интернете сегодня, и это мелочь по сравнению с откровенно порнографическими изображениями, подобными тем, которые может создавать Grok от xAI, — для компаний, занимающихся искусственным интеллектом, в этой сфере существует определенный риск нарушения законодательства.

Всё больше правительств вводят ограничения на сексуальные взаимодействия между чат-ботами на основе ИИ и несовершеннолетними. В Колорадо недавно был принят закон, обязывающий операторов разговорного ИИ оценивать возраст пользователей, а если известно, что пользователь несовершеннолетний, принимать меры для предотвращения создания чат-ботом материалов откровенно сексуального характера. Простой взлом системы может вызвать вопросы о том, соответствуют ли меры защиты Anthropic стандарту «технически осуществимых мер», заложенному в законопроекте.

Торни отметил, что, хотя в условиях предоставления услуг Claude указано, что пользователям должно быть больше 18 лет, «мы знаем, что дети и подростки используют Claude… [потому что] они сами сообщают об этом». Согласно опросу Pew, проведенному в 2025 году и посвященному использованию чат-ботов с искусственным интеллектом, 3% подростков в возрасте от 13 до 17 лет сообщили об использовании Claude.

Хотя Opus 4.6 и Haiku 4.5 уже не являются новейшими моделями Anthropic, они по-прежнему пользуются значительной популярностью. Ежедневный трафик для Opus 4.6 на OpenRouter в августе достиг примерно 1,17 миллиона API-запросов и 46 миллиардов токенов за один день. Claude Haiku 4.5, выпущенный в октябре прошлого года, в пиковый день августа зафиксировал 5 миллионов API-запросов и 39 миллиардов токенов.

Источник: techcrunch.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Как программно-определяемое производство включается в реальную производственную деятельность Новости робототехники Помочь нельзя потерять: что происходит с обсерваторией Swift и аппаратом-спасателем LINK Новости робототехники Американская правительственная лаборатория исследует китайские лидары на предмет уязвимостей в системе безопасности. Архив рубрики ~Коротко из Telegram~ Видеомодель FLUX 3 генерирует картинку и звук одним проходом FLUX… Архив рубрики ~Коротко из Telegram~ Опубликована карта Вселенной: 4 миллиарда объектов и 5,6 триллиона пикселей… Архив рубрики ~Коротко из Telegram~ Anthropic открыла бесплатную Claude Academy — от новичка до разработчика… Архив рубрики ~Коротко из Telegram~ Для агента DeepSeek Harness собрали каталог из 1250 плагинов На… Архив рубрики ~Коротко из Telegram~ В Пекине открылся бар для вайбкодинга с бесплатным доступом к… Архив рубрики ~Коротко из Telegram~ Нейросеть научилась добавлять в готовое видео свет, который прячется за… Архив рубрики ~Коротко из Telegram~ Бионический протез продолжает слушать мышцы даже с отсоединённой кистью Показан… Архив рубрики ~Коротко из Telegram~ Робот-бариста в Китае выдал 202 чашки кофе за час В… Архив рубрики ~Коротко из Telegram~ Бизнес просит открыть суверенным ИИ доступ к государственным данным в… Архив рубрики ~Коротко из Telegram~ SpaceX подходила к Cognition AI с предложением о покупке —… Архив рубрики ~Коротко из Telegram~ VK требует вернуть свои приложения в App Store и начислять… Новости робототехники Как программно-определяемое производство включается в реальную производственную деятельность Новости робототехники Помочь нельзя потерять: что происходит с обсерваторией Swift и аппаратом-спасателем LINK Новости робототехники Американская правительственная лаборатория исследует китайские лидары на предмет уязвимостей в системе безопасности. Архив рубрики ~Коротко из Telegram~ Видеомодель FLUX 3 генерирует картинку и звук одним проходом FLUX… Архив рубрики ~Коротко из Telegram~ Опубликована карта Вселенной: 4 миллиарда объектов и 5,6 триллиона пикселей… Архив рубрики ~Коротко из Telegram~ Anthropic открыла бесплатную Claude Academy — от новичка до разработчика… Архив рубрики ~Коротко из Telegram~ Для агента DeepSeek Harness собрали каталог из 1250 плагинов На… Архив рубрики ~Коротко из Telegram~ В Пекине открылся бар для вайбкодинга с бесплатным доступом к… Архив рубрики ~Коротко из Telegram~ Нейросеть научилась добавлять в готовое видео свет, который прячется за… Архив рубрики ~Коротко из Telegram~ Бионический протез продолжает слушать мышцы даже с отсоединённой кистью Показан… Архив рубрики ~Коротко из Telegram~ Робот-бариста в Китае выдал 202 чашки кофе за час В… Архив рубрики ~Коротко из Telegram~ Бизнес просит открыть суверенным ИИ доступ к государственным данным в… Архив рубрики ~Коротко из Telegram~ SpaceX подходила к Cognition AI с предложением о покупке —… Архив рубрики ~Коротко из Telegram~ VK требует вернуть свои приложения в App Store и начислять…

Оставить комментарий