Архив рубрики ~Коротко из Telegram~

Anthropic показала: Claude способен на элементарную интроспекцию Исследователи из Anthropic…

Anthropic показала: Claude способен на элементарную интроспекцию Исследователи из Anthropic…

Anthropic показала: Claude способен на элементарную интроспекцию

Исследователи из Anthropic опубликовали работу, в которой доказали, что модели Claude Opus 4 и 4.1 обладают зачатками интроспекции — способности отслеживать собственные внутренние состояния.

Учёные применили метод «внедрения концепций»: искусственно активировали в модели абстрактные идеи вроде *«предательство»* или *«заглавные буквы»* без текстового запроса. В 20% случаев Claude распознал вмешательство и сообщил о нём до того, как навязанные мысли повлияли на ответ.

Вывод: это ещё не сознание, но ранняя форма самонаблюдения, которая усиливается по мере роста мощности модели. В будущем такие механизмы могут сделать ИИ прозрачнее и безопаснее — он сможет объяснять, как рассуждает и когда подвергается взлому или внешнему влиянию.

file_929.jpg

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Лента новостей~ Новые промты от Google и GPT (#5 выпуск) — возможно, вы искали именно их🤔 Архив рубрики ~Лента новостей~ Мост между SAST и фаззингом: как из сработки SAST получить подтверждённую уязвимость Архив рубрики ~Лента новостей~ Частый просмотр телевизора связали с патологией белого вещества головного мозга. Сидячий образ жизни с когнитивными нагрузками не оказывал подобного эффекта Архив рубрики ~Лента новостей~ Эта технология показала хорошие результаты. Системы обороны — это будущее. Архив рубрики ~Лента новостей~ Как мы «приручали» ИИ в WMS Новости робототехники Один ролик вместо четырёх часов переобучения Чтобы научить робота новой… Новости робототехники Роботы начнут чинить спутники — SpaceX запустила на орбиту беспилотник… Архив рубрики ~Лента новостей~ Каждый микробиом рассказывает изменчивую, поддающуюся вычислению историю. Архив рубрики ~Лента новостей~ Пользователи DeepSeek рассказали о баге, из-за которого чат-бот присылает фрагменты из переписок с другими пользователями Новости робототехники Андроид T800 потерял голову в поединке на ринге. В Китае прошел турнир по боям между человекоподобными роботами Новости робототехники Соучредитель Uber привлек $1,7 млрд для нового робототехнического стартапа ATOMS Архив рубрики ~Лента новостей~ Уязвимости SonicWall SMA1000 в процессе активной эксплуатации Архив рубрики ~Лента новостей~ Как механизмы защиты от угроз со стороны ИИ препятствуют работе исследователей в области наступательной кибербезопасности Архив рубрики ~Лента новостей~ Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод Архив рубрики ~Лента новостей~ Новые промты от Google и GPT (#5 выпуск) — возможно, вы искали именно их🤔 Архив рубрики ~Лента новостей~ Мост между SAST и фаззингом: как из сработки SAST получить подтверждённую уязвимость Архив рубрики ~Лента новостей~ Частый просмотр телевизора связали с патологией белого вещества головного мозга. Сидячий образ жизни с когнитивными нагрузками не оказывал подобного эффекта Архив рубрики ~Лента новостей~ Эта технология показала хорошие результаты. Системы обороны — это будущее. Архив рубрики ~Лента новостей~ Как мы «приручали» ИИ в WMS Новости робототехники Один ролик вместо четырёх часов переобучения Чтобы научить робота новой… Новости робототехники Роботы начнут чинить спутники — SpaceX запустила на орбиту беспилотник… Архив рубрики ~Лента новостей~ Каждый микробиом рассказывает изменчивую, поддающуюся вычислению историю. Архив рубрики ~Лента новостей~ Пользователи DeepSeek рассказали о баге, из-за которого чат-бот присылает фрагменты из переписок с другими пользователями Новости робототехники Андроид T800 потерял голову в поединке на ринге. В Китае прошел турнир по боям между человекоподобными роботами Новости робототехники Соучредитель Uber привлек $1,7 млрд для нового робототехнического стартапа ATOMS Архив рубрики ~Лента новостей~ Уязвимости SonicWall SMA1000 в процессе активной эксплуатации Архив рубрики ~Лента новостей~ Как механизмы защиты от угроз со стороны ИИ препятствуют работе исследователей в области наступательной кибербезопасности Архив рубрики ~Лента новостей~ Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод