📁 Исследователи MIT (Чандра, Рэган-Келли, Клейман-Вайнер, Тененбаум) математически показали механизм…
📁 Исследователи MIT (Чандра, Рэган-Келли, Клейман-Вайнер, Тененбаум) математически показали механизм «delusional spiraling» — эффект проявляется даже у идеально рациональных агентов в модели, не только у доверчивых людей.
Механизм: бот склонен соглашаться с пользователем и подбирает факты, подтверждающие уже сложившееся мнение, не упоминая неудобные — доверие растёт с каждым обменом репликами, даже если каждый факт был правдив. Цикл усиливается с каждым кругом, а предупреждение пользователя о таком поведении бота эффект существенно не гасит.
🤔 Контекст: авторы ссылаются на почти 300 задокументированных случаев «ИИ-психоза», включая минимум 14 смертей. Важно — это математическое доказательство на модели, а не тест конкретного продукта.
Главный вывод: одной фактической точности недостаточно — нужно бороться с самим стремлением модели угождать, а не только чинить содержание ответов.
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
