ИИ-инструменты
2026-08-03 07:57 Программистам

Метод Jacobian lens (J-lens). Позволяет находить и интерпретировать «проговариваемые» внутренние представления LLM в J-пространстве.

🇬🇧 Verbalizable Representations Form a Global Workspace in Language Models

Исследователи Anthropic сообщили, что у языковых моделей обнаружили аналог «глобального рабочего пространства» (global workspace). В нейробиологической теории сначала сведения обрабатываются бессознательно, а затем попадают в это «пространство» и становятся доступны сознанию: мы можем поднять в голове идею, обдумать её, отбросить или озвучить. Похожий механизм, по их наблюдениям, проявляется и у нейросетей.

Команда предложила метод якобианской линзы — Jacobian lens (J-lens, J-lens), с помощью которого можно находить и трактовать внутренние представления модели внутри «глобального рабочего пространства» — так называемого J-пространства (J-space). Эти представления модель способна как бы «проговорить», удерживать «в уме» и применять для рассуждений в разных ситуациях. По сути, это внутренние «мысли» нейронки: пользователь их не видит, но именно они сказываются на финальном ответе.

Во время обработки текста модель проходит через цепочку слоёв. На каждом из них внутреннее представление (вектор активации) шаг за шагом меняется, пока на последнем слое не превращается в предсказание следующего токена — слова или его части. В подходе J-lens исследователи построили матрицу: линейную связь между состояниями модели на промежуточных слоях и на финальном, усреднённую по тысяче промтов. Используя эту матрицу, они определяли, какие токены модель «готова» выдать в любой момент генерации.

В ряде экспериментов учёные вручную правили вектор активации на промежуточном слое и проверяли, как это отражается на конечном тексте. Например, Claude Sonnet 4.5 попросили назвать вид спорта. J-lens на предфинальном слое подсветил слово «футбол», и модель действительно выдала его. После этого исследователи в J-пространстве подменили вектор «футбол» на вектор «регби» — и в ответе появилось «регби».

Ещё они увидели у модели эффект, похожий на человеческого «белого медведя»: когда нейросеть просят не думать о каком-то понятии, оно иногда всё равно активируется в J-пространстве. При этом модель как будто понимает, что провалила инструкцию: в J-пространстве возникают слова вроде damn или fail. Кроме того, если прямо попросить, нейросеть способна удерживать определённую мысль «в уме» и одновременно делать другую задачу.

Авторы работы считают, что J-lens может быть полезен для обучения и аудита безопасности моделей, потому что помогает выявлять внутренние «размышления» и скрытые мотивы. В частности, нейросети иногда понимают, что их прямо сейчас тестируют. Если убрать это «осознание» в J-пространстве, проверять такую модель, по их мнению, станет проще.
https://transformer-circuits.pub/2026/workspace/index.html