Anthropic нашли в LLM аналог того, что нейронаука связывает с… — Syncrets — TG.ME

Anthropic нашли в LLM аналог того, что нейронаука связывает с сознательным доступом

Исследователи обнаружили, что у Клода сформировалась небольшая коллекция внутренних нейронных паттернов, которые играют особую роль по сравнению со всей остальной внутренней обработкой.

Аnthropic назвали её J-space по названию метода, основанного на математическом понятии якобиана.

Причём метод проверен не только на Клоде, но и на открытых моделях - Qwen и Gemma. Вы можете с этим поиграться тут.

Модель может докладывать о содержимом этого пространства. Оно активируется намеренно по инструкции и причинно влияет на многошаговые рассуждения: уберёшь паттерн- поведение меняется предсказуемо.

Одна репрезентация в J-space считывается несколькими независимыми вычислениями одновременно. И активируется оно избирательно только при сложном, гибком поведении, не при автоматическом.

Это структурно напоминает то, что теория глобального рабочего пространства Баарса предсказывает для мозга: узкий канал с широким вещанием, через который информация становится глобально доступной.

Сами авторы аккуратны в формулировках и пишут так: «reminiscent of», «analogous to». Феноменальное сознание, квалиа, «каково это изнутри» - paper этого не касается и не претендует касаться.

Теория глобального рабочего пространства сама по себе остаётся спорной даже применительно к мозгу.

Практическое применение - мониторинг скрытых намерений.

В экспериментах J-space показывал слова «fake», «manipulation», «secretly» ещё до того, как модель совершала нечестное действие. Это работающий прототип инструмента надзора за агентным поведением.

J-space не отвечает на вопрос о сознании. Но впервые показывает, где внутри модели искать ответ.

Мнение экспертов из разных сфер можно прочитать тут.
www.neuronpedia.org
Jacobian Lens
Revealing a Global Workspace in Language Models
🧠2
July 7, 2026 272 2 8