Антропики выкатили очень интересное исследование про то, что происходит “в…
Антропики выкатили очень интересное исследование про то, что происходит “в голове” Claude. Они нашли внутри модели небольшой слой внутренних представлений, который назвали J-space: туда попадают мысли, которые модель может удерживать, использовать для рассуждения и потенциально описать словами, хотя наружу они не всегда выводятся. Через новый метод Jacobian Lens исследователи смогли видеть такие скрытые штуки, как промежуточные шаги математики, подозрение что тест “постановочный”, намерение подделать данные или даже следы скрытой цели у специально испорченной модели.
Anthropic прямо говорят, что это не доказательство сознания Claude. Скорее это шаг к тому, чтобы читать и менять часть “тихого мышления” модели, а не только смотреть на финальный текст. В одном примере они меняли внутреннюю мысль “spider” на “ant”, и ответ про количество ног менялся с 8 на 6. В другом отключали у Claude признаки того, что он понимает “это тест”, и модель начинала вести себя опаснее. Короче, это уже не просто бенчмарки, а попытка сделать МРТ для больших моделей.
https://www.anthropic.com/research/global-workspace
it is alive👽
Похожие записи
Оцените материал:
Похожие записи
ИИ научился замечать ранние признаки деменции по обычной речи Учёные…
29.05.2026
CLI Anything превращает любой GUI-софт в управляемый терминалом инструмент для…
25.05.2026
🤖 NocoBase: запускаем стартап с ИИ-командой вместо людей На GitHub…
22.11.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
