БИЗНЕС И ЦИФРОВИЗАЦИЯ

Anthropic выявила скрытые мысли ИИ Claude — J-space анализирует внутренние паттерны

Anthropic обнаружила J-space в ИИ Claude — новая технология анализирует мысли модели, не озвученные вслух.

✍️ Редакция iTech News | 21.10.2025 | ⏱ 2 мин | Источник: Habr / Новости
Anthropic открывает тайны ИИ Claude с помощью J-space

Anthropic представила новый подход к анализу внутреннего состояния искусственного интеллекта Claude, внедрив технологию J-space. Эта система считывает нейронные паттерны, которые указывают на мысли модели, но не озвученные вслух, что может существенно изменить подход к пониманию работы ИИ.

Что такое J-space

Исследователи Anthropic обнаружили, что Claude активирует уникальные нейронные паттерны в ответ на различные слова или концепции, даже если эти слова не произносятся. Это пространство, названное J-space, не было преднамеренно спроектировано, оно возникло в процессе обучения модели. Таким образом, J-space функционирует как молчаливая зона, обеспечивая внутренний анализ, который не виден во входящих данных или ответах Claude.

При работе с J-space, чтобы проиллюстрировать функционирование этой технологии, исследователи провели эксперименты, в которых Claude могла «загадать» спорт. Для примера, если J-lens показывал «футбол», и исследователи вручную заменяли это на «регби», Claude успешно ответила, что загадала регби. Это подтверждает, что J-space не просто пассивная функция, а активная часть логики, из которой модель черпает свои ответы.

Анализируем скрытые мысли

Окно в J-space позволяет увидеть, как Claude реагирует на различные сценарии. Например, при чтении кода с ошибкой в J-space загорается «ERROR», а при обнаружении поддельных результатов поиска появляются слова «injection» и «fake». Это подразумевает, что ИИ имеет понимание контекста, даже если не формулирует его явно. Такие особенности могут иметь важное значение в контексте безопасности искусственного интеллекта, поскольку данный инструмент J-lens способен ловить потенциальные проблемы и неправильные выводы.

К примеру, в тестовом сценарии, когда Claude подвергался манипуляциям, его J-space показывал слова «fake» и «fictional», что говорило о том, что модель осознает постановочные условия. Это открытие может помочь в разработке более безопасных ИИ-систем, предотвращая распространение ошибочной информации и манипуляций.

Практическое значение для рынка

Для разработчиков ИИ это открытие имеет важные практические выводы. Ведь использование таких технологий, как J-space, может помочь в создании более прозрачных и надежных систем. Улучшенное понимание того, как внутренние процессы ИИ могут влиять на его поведение, позволит повысить уровень безопасности и надежности приложений. Это особенно актуально в условиях растущего внимания к этике и безопасности AI-технологий.

Следующий шаг для Anthropic — продолжение тестирования J-space в различных сценариях и разработка методов, которые позволят интегрировать эти технологии в более широкий спектр приложений, сделав ИИ Claude не только более эффективным, но и безопасным.

Поделиться: Telegram X LinkedIn