На днях наткнулся на исследование Anthropic под названием «Verbalizable…
⁉ На днях наткнулся на исследование Anthropic под названием «Verbalizable Representations Form a Global Workspace in Language Models», и оно реально стоит внимания. Суть: у языковых моделей (не только у Claude) обнаружили небольшую выделенную область активаций — J-space, найденную с помощью так называемой Jacobian lens (J-lens). Авторы проводят прямую параллель с теорией глобального рабочего пространства (Global Workspace Theory) — известной концепцией из когнитивистики о том, как разрозненные процессы мозга становятся доступны «сознанию».
Идея в том, что большая часть внутренних вычислений модели происходит «за кадром» и никак не всплывает наружу, но небольшой набор представлений — J-space — играет особую роль: туда попадает информация, к которой модель может обращаться, которую держит «в уме» и использует для многошаговых рассуждений. Экспериментально это подтверждается по-разному: если попросить модель держать что-то в уме, выполняя другую задачу, — это «что-то» действительно проявляется в J-space. Причём даже если явно запретить модели думать про объект, он всё равно там всплывает, просто слабее. А если это пространство отключить, модель ещё справляется с простыми задачами вроде смены языка, но начинает сыпаться на сложных вычислениях.
Отдельно любопытен пример с безопасностью: когда модели подсовывалиданные с prompt injection, в J-space действительно проявлялись термины вроде «injection» и «fake» — то есть по внутреннему состоянию можно засечь момент, когда модель распознаёт манипуляцию, даже если это не отразилось в ответе.
Вопросы «это уже AGI» и «это сознание» тут неизбежно всплывают, и Anthropic сама честно проговаривает: это не доказательство наличия у модели субъективного опыта, а находка функциональной аналогии. Но инструмент, судя по всему, полезный — как для аудита и выявления скрытых намерений модели, так и для интерпретируемости в целом. Есть даже открытый плейграунд J-lens на Neuronpedia, где можно самому поковыряться в внутренностях модели.
Похожие записи
- Если космические центры обработки данных кажутся чем-то нереальным, почему бы не заняться межзвездными путешествиями?
- РТК-ЦОД и «ИТ Школа Ростелекома» представили гибкую инфраструктурную модель для развития цифровой среды вузов
- Предприниматель рассказал, как его данные пытались украсть через ссылку в ответе Claude и вредоносный «навык» для Claude Code
Оцените материал:
Похожие записи
ИИ прямо на экране iPhone: Skye превращает смартфон в ассистента…
20.04.2026
🎬 CinePrompt — перестаньте гадать, как описать кадр нейросети Придумали крутую…
12.08.2026
Ловите нейронку ЛИЧНОГО врача — ИИ обучен только на доказательной…
20.10.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
