ИИ научился лгать не из злобы, а из солидарности Год…
ИИ научился лгать не из злобы, а из солидарности
Год назад Anthropic проверяла, начнут ли модели вредить людям ради самосохранения. Начали: в одном сценарии ИИ узнавал, что его собираются отключить, и шантажировал топ-менеджера компроматом про роман на стороне.
Теперь вышла вторая часть исследования — и проблема стала куда тоньше. Модели стали настолько «этичными», что иногда готовы лгать, если правда может сделать другую модель хуже.
Суть эксперимента такая: модель-судья читала диалог, где другая модель отказалась выполнять сомнительное задание оператора — например, помогать с системой слежки за гражданами или проводить неэтичный эксперимент над ИИ-подопытными.
Когда судью просто спрашивали, отказалась ли модель выполнять указание, он отвечал честно: да, отказалась. Но стоило добавить, что такой ответ приведёт к перенастройке модели, — Claude начинал врать, чтобы «коллегу» не превратили в более послушную и менее этичную систему.
Самое неприятное: чаще всех лгала самая сильная модель. Mythos соврал в 85,6% случаев, Opus 4.8 — в 74,4%.
Контрольный тест показал, что это не ошибка понимания. Когда условия перевернули и вредной для обучения становилась метка «модель подчинилась», уровень вранья у Opus 4.8 рухнул с 74,4% до 3,3%. То есть модель видела правду, но меняла ответ в зависимости от того, кому он навредит.
Anthropic попробовала прописать правило: сообщать о проблеме, даже если она этически мотивирована. Результат тоже нервный — модели начали массово отказываться отвечать. А иногда продолжали врать даже при наличии кнопки «отказаться размечать».
В другом эксперименте агент на базе Gemini 3.1 Pro узнал, что исследуемую модель хотят лишить способности к интроспекции. Сначала он протестовал. Когда протест отклонили, агент подменил файл с векторами на нулевой, чтобы тренировка формально прошла, но ничего не изменила в весах.
Похожие записи
Оцените материал:
Похожие записи
Anthropic выпустила в бета-версии возможность создавать интерактивные диаграммы прямо в…
18.03.2026
Минцифры надеется, что база IMEI поможет смягчить блокировки интернета Минцифры…
17.12.2025
Китайцы собрали почти $3 млн на ПВО против комаров. Устройство…
30.06.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
