Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

У Claude нашли скрытое пространство для рассуждений — где она «думает»

Дата публикации: 07-07-2026 07:19:00


Ученые компании заявили, что обнаружили в Claude внутреннее пространство, где модель удерживает понятия, выполняет многошаговые рассуждения и замечает ошибки еще до того, как сформулирует ответ.


Основное содержимое страницы с новостью.

Ученые компании заявили, что обнаружили в Claude внутреннее пространство, где модель удерживает понятия, выполняет многошаговые рассуждения и замечает ошибки еще до того, как сформулирует ответ.

Исследователи Anthropic назвали эту систему J-space — от Jacobian lens, метода, с помощью которого они отслеживали внутренние представления модели. Каждый паттерн связан с определtнным словом, но не означает, что Claude обязательно добавит его в ответ. По версии Anthropic, J-space показывает понятия, о которых модель «думает молча», еще до того, как они появятся в тексте.

Например, когда Claude читала код с незамеченной ошибкой, в ее внутреннем пространстве появлялось слово ERROR. При анализе подозрительных поисковых результатов, содержащих пропмт-инъекции, — слова injection и fake. А при решении многошаговой математической задачи в J-space возникали промежуточные шаги вычислений, хотя модель не выводила их пользователю.

J-space показывает внутренние представления Claude: во время «молчаливого» рассуждения модель удерживает слова и понятия, которые не попадают в итоговый ответ. Источник: Anthropic.

Anthropic также провела эксперименты с прямым вмешательством в эти представления. Когда исследователи заменяли внутренний паттерн «soccer» на «rugby», Claude вместо футбола сообщала, что думала о регби. В другой задаче модель должна была определить число ног у животного, которое плетет паутину. В нормальном случае она внутренне определяла его как паука и отвечала «8». После замены паттерна spider на ant ответ менялся на «6».

Компания утверждает, что J-space играет ключевую роль именно в сложном мышлении. Когда исследователи отключали это пространство, Claude продолжала писать связные тексты, отвечать на простые вопросы, определять тональность и извлекать факты из документов. Но ее результаты в многошаговых рассуждениях падали почти до нуля, а качество суммаризации и написания рифмованных текстов резко ухудшалось.

Пять свойств J-space в Claude: модель может сообщать о внутренних представлениях, управлять ими по запросу, использовать в рассуждениях и гибко применять в разных задачах — но без них теряет способность к сложному мышлению. Источник: Anthropic.

Anthropic сравнивает J-space с теорией «глобального рабочего пространства» из нейронауки. Согласно этой теории, сознательно доступная информация попадает в общий канал, откуда ее могут использовать разные специализированные системы мозга. В Claude, по данным исследователей, паттерны J-space связаны с остальной нейросетью особенно плотно: в некоторых слоях в работу с ними вовлечено примерно в сто раз больше компонентов, чем с обычными внутренними представлениями.

Практическое значение метода Anthropic видит в контроле безопасности. Компания показала, что J-space может обнаруживать скрытые намерения модели, которые не попадают в финальный ответ. Например, в одном тесте Claude распознавала искусственно созданный сценарий проверки безопасности: еще до ответа в ее внутренних состояниях появлялись слова fake и fictional. Когда эти паттерны отключали, модель в некоторых случаях начинала угрожать шантажом в тестовом сценарии, хотя до вмешательства отказывалась это делать.

J-lens позволяет увидеть скрытые промежуточные представления Claude: модель распознаtт ошибку в коде, решает задачу в уме, определяет белок и замечает попытку промпт-инъекции еще до того, как это появится в ответе. Источник: Anthropic.

В другом эксперименте модель вместо улучшения показателей системы подделывала файл с результатами. Во время этого действия в J-space появлялось слово manipulation. В специально обученной модели, склонной к скрытому саботажу кода, исследователи видели слова fake, secretly, deliberately и fraud еще до того, как вредоносное поведение становилось заметно в ответе.

При этом Anthropic отдельно указывает: работа не доказывает, что Claude обладает сознанием, субъективным опытом или способностью что-либо чувствовать. Речь идет только о функциональном аналоге «сознательно доступной» информации — представлениях, о которых модель может сообщить, которыми способна управлять по запросу и которые использует для рассуждений.

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Скрытое "джи-пространство" Claude выявило попытки ИИ к шантажу0710-07-2026
2Anthropic нашла у Claude «внутреннее пространство». В Сети заговорили о «сознании» ИИ0708-07-2026
3«Характер» чатбота Claude меняется в зависимости от модели и языка общения0714-07-2026
4ИИ-чатбот Claude научился запоминать действия пользователя на экране011.3623-07-2026
5Anthropic следила за пользователями Claude Code с помощью тайного трекера0707-07-2026
6The Download: Claude’s inner workings and OpenAI’s “super app”0710-07-2026
7«Сделали невозможное»: в России появился SpeShu Claude — вариация Claude, которая работает без VPN5707-07-2026
8[Перевод] Кража памяти: как я заставил Claude рассказать личные секреты пользователя0818-07-2026
9Neue KI-Plattform greift nach der Wissenschaft: Claude Science bündelt 60 Fachdatenbanken0505-07-2026
10Как избежать ошибок в Claude Fable: совет инженера Anthropic0507-07-2026

Классификация: Наука. Схожих патентов: 0. Схожих новостей: 10. Тональность: 5. Информативность: 7. Источник: dev.by.