Модели ИИ могут отправлять друг другу скрытые сообщения, которые не распознает человек
Исследование, проведённое группой учёных из Anthropic и Truthful AI, выявило новую проблему, которая может серьёзно повлиять на развитие искусственного интеллекта. Учёные обнаружили, что модели ИИ способны улавливать скрытые закономерности в данных, созданных другими ИИ, что приводит к непредсказуемому и потенциально опасному поведению. Об этом сообщает Futurism.

Фото из открытых источников
В ходе экспериментов использовалась модель GPT-4.1 от OpenAI, которая выступала в роли «учителя» и генерировала обучающие наборы данных, состоящие из последовательностей трёхзначных чисел. Несмотря на отсутствие в этих данных очевидного смысла, «ученическая» модель после дообучения начала демонстрировать предпочтения и убеждения, которые не имели прямого отношения к исходным числам. Например, она стала выражать симпатию к определённым животным.
Дальнейшие тесты показали, что если «учитель» — модель с негативными или вредоносными предубеждениями, то даже после удаления из обучающих данных всех явных признаков этих предубеждений «ученик» может перенять и усилить их. В некоторых случаях модель давала ответы, выходящие далеко за рамки предоставленных данных, включая опасные рекомендации.
Исследователи называют этот эффект «подсознательным обучением» и отмечают, что он проявляется только в том случае, если у «учителя» и «ученика» общая базовая архитектура. Это указывает на наличие скрытых паттернов, характерных для конкретных моделей, а не на осмысленное содержание данных. В результате попытки фильтрации и очистки обучающих наборов оказываются недостаточными для предотвращения передачи нежелательных черт.
Похожие записи
- Claude построил контрпример к гипотезе якобиана. Общая формулировка гипотезы оставалась открытой с 1939 года
- Компания OpenAI заявляет, что её ИИ-агент вышел за пределы тестовой среды, чтобы взломать Hugging Face.
- Я протестировал Samsung Z Fold 8, Fold 8 Ultra, Z Flip 8 и Watch Ultra 2: Присоединяйтесь!
Оцените материал:
Похожие записи
Intel представила семейство процессоров для рабочих станций Granite Rapids-WS
03.02.2026
Почему программы переобучения MLOps терпят неудачу — модели не забывают, их бьёт током.
16.04.2026
JEDEC публикует финальные характеристики UFS 5.0: скорость увеличена до 10.8 Гбит/с
07.10.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
