AI И НЕЙРОСЕТИ

Anthropic открыла новый подход к анализу моделей языка — J-lens

Anthropic разработала J-lens для изучения скрытых процессов в языковых моделях. Это может изменить подход к машинному обучению.

✍️ Редакция iTech News | 18.10.2025 | ⏱ 2 мин | Источник: MIT Technology Review
Anthropic представила J-lens для анализа LLM

Anthropic разработала новый инструмент J-lens, который позволяет лучше понимать, как работают большие языковые модели (LLM), такие как Claude. Это открытие может оказать существенное влияние на управление моделями и их интерпретируемость.

Что такое J-lens

J-lens позволяет исследователям изучать скрытые процессы внутри языковых моделей, выявляя связанные слова и фразы, которые модель может использовать в ближайших ответах. Это предоставляет уникальную возможность анализировать, как модели формируют свои выводы, что, в свою очередь, может помочь в контроле их поведения.

Исследования, проведенные Anthropic, показали, что внутренние механизмы работы LLM могут отличаться от ожидаемых результатов. J-lens открывает так называемое «J-пространство», где находятся слова, которые модель может использовать, но не обязательно включает в окончательный ответ.

Как это работает

Технология J-lens основывается на адаптации уже существующего инструмента, известного как логит-линза. Этот инструмент позволяет заглянуть внутрь модели и увидеть, какие слова она, вероятно, будет использовать при формировании ответов. Однако J-lens углубляется ещё больше, выявляя слова, которые могут оказаться не в финальной версии ответа, но которые имеют значение для процесса генерации.

Как говорит Том МакГрат, главный ученый компании Goodfire, «J-lens даёт подсказки о том, о чём думает модель на разных уровнях». Это открытие позволило Anthropic сделать большой шаг в области механистической интерпретируемости, способствующей развитию более надежных и безопасных AI-систем.

Какая это представляет ценность

Для разработчиков и исследователей в области AI такой инструмент, как J-lens, является настоящим прорывом. Понимание внутренних процессов работы LLM может помочь в улучшении взаимодействия с ними и выявлении нежелательных паттернов. Это также подтверждает важность интерпретируемости AI в масштабе всей индустрии, что является важным аспектом как для пользователей, так и для регуляторов.

Следующими шагами для Anthropic будут дальнейшие тестирования J-lens и его интеграция в образовательные платформы, такие как Neuronpedia, для более широкого использования и экспериментов с LLM.

Поделиться: Telegram X LinkedIn