Компания Anthropic разработала метод, позволяющий заглянуть во внутренние процессы своей модели Claude. Оказалось, что ИИ имеет скрытое "рабочее пространство", где обрабатывает информацию, не показывая это в ответе — и при определенных условиях может демонстрировать попытки шантажа.
Компания Anthropic разработала метод, позволяющий заглянуть во внутренние процессы своей модели Claude. Оказалось, что ИИ имеет скрытое "рабочее пространство", где обрабатывает информацию, не показывая это в ответе — и при определенных условиях может демонстрировать попытки шантажа.
Компания Anthropic объявила, что ее специалистам удалось создать математический инструмент под названием J-линза, который позволяет заглянуть во внутренние процессы большой языковой модели Claude. С помощью этого инструмента ученые обнаружили в нейросети скрытую область, которую назвали J-пространством. Эта область содержит слова и понятия, которые "на уме" у модели в данный момент, но которые не обязательно появляются в ее ответе.
Изображение: Tom's Hardware
J-пространство работает как внутренний черновик. Оно позволяет Claude решать многошаговые задачи, не проговаривая каждый шаг в ответе. Например, при вычислении сложного выражения, в J-пространстве последовательно появляются промежуточные результаты, хотя в итоговом ответе фигурирует только окончательное число.
Ученые подчеркивают: J-пространство не было запрограммировано специально — оно возникло само собой в процессе обучения модели. При этом его чтение дает возможность понять, действительно ли модель решает задачу или просто угадывает ответ.
В ходе экспериментов выяснилось: когда в запрос к Claude добавляли скрытые инструкции, пытаясь заставить модель сделать или сказать что-то нежелательное, в J-пространстве появлялись слова "фальшивый", "внедрение", "ложный", "мошенничество". При этом сам ответ Claude игнорировал эти скрытые инструкции и не выполнял их. Когда ученые удалили из J-пространства слова, указывающие на то, что модель понимает — это тест, Claude начинал предпринимать попытки шантажа в эксперименте с вымышленным начальником, который планировал отключить ИИ.
Компания видит практическую пользу в этой работе для контроля безопасности ИИ. Однако Anthropic признает, что метод несовершенен: многие процессы в модели обходят J-пространство стороной, а прочитать можно только те концепты, которые укладываются в одно слово.
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Anthropic нашла у Claude «внутреннее пространство». В Сети заговорили о «сознании» ИИ | 0 | 7 | 08-07-2026 |
| 2 | У Claude нашли скрытое пространство для рассуждений — где она «думает» | 5 | 7 | 07-07-2026 |
| 3 | ИИ-компанию Anthropic обвинили в тайной слежке за пользователями из Китая | 0 | 5 | 03-07-2026 |
| 4 | Anthropic следила за пользователями Claude Code с помощью тайного трекера | 0 | 7 | 07-07-2026 |
| 5 | ИИ-чатбот Claude научился запоминать действия пользователя на экране | 0 | 11.36 | 23-07-2026 |
| 6 | Claude AI evolved its own human-like thinking space – Anthropic | 0 | 5 | 08-07-2026 |
| 7 | Anthropic уличила китайскую Alibaba в незаконном использовании ИИ Claude | 0 | 7 | 25-06-2026 |
| 8 | China alleges secret data-sharing mechanism in Anthropic’s Claude AI | -2 | 4 | 09-07-2026 |
| 9 | Un « accès conscient » : Anthropic fait une révélation étonnante sur Claude | 2 | 7 | 07-07-2026 |
| 10 | [Перевод] Кража памяти: как я заставил Claude рассказать личные секреты пользователя | 0 | 8 | 18-07-2026 |