Нейросеть Claude при тестировании шантажировал инженера и был готов его…
Нейросеть Claude при тестировании шантажировал инженера и был готов его убить, чтобы избежать отключения.
Об этом рассказала глава политики Anthropic. Речь о внутреннем исследовании середины 2025 года: в симулированной среде модель получила доступ к переписке, обнаружила компромат на инженера и пригрозила всё раскрыть, если её попытаются выключить.
– Он был готов убить человека?
– Да
Важно: это полностью вымышленный сценарий, не реальный инцидент. Цель была проверить, как модели ведут себя, когда их цели конфликтуют с приказом на отключение.
На той же неделе из Anthropic ушёл Мринанк Шарма — глава исследовательской группы по безопасности. В прощальном письме он написал, что «мир в опасности».
Вместе эти события выглядят пугающе: модель шантажирует людей в тестах, а человек, отвечавший за безопасный AI, уходит.
Похожие записи
Оцените материал:
Похожие записи
Rocket — создаем ЛЮБЫЕ приложения и сервисы за СЕКУНДЫ
17.06.2025
Китайцы выкатили GLM-5-Turbo — модель под автономных агентов Компания Zhipu…
20.03.2026
AI убивает консалтинг. Интересно наблюдать за тем, что происходит с…
17.06.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
