Anthropic разработала новый инструмент J-lens, который позволяет лучше понимать, как работают большие языковые модели (LLM), такие как Claude. Это открытие может оказать существенное влияние на управление моделями и их интерпретируемость.
Что такое J-lens
J-lens позволяет исследователям изучать скрытые процессы внутри языковых моделей, выявляя связанные слова и фразы, которые модель может использовать в ближайших ответах. Это предоставляет уникальную возможность анализировать, как модели формируют свои выводы, что, в свою очередь, может помочь в контроле их поведения.
Исследования, проведенные Anthropic, показали, что внутренние механизмы работы LLM могут отличаться от ожидаемых результатов. J-lens открывает так называемое «J-пространство», где находятся слова, которые модель может использовать, но не обязательно включает в окончательный ответ.
Как это работает
Технология J-lens основывается на адаптации уже существующего инструмента, известного как логит-линза. Этот инструмент позволяет заглянуть внутрь модели и увидеть, какие слова она, вероятно, будет использовать при формировании ответов. Однако J-lens углубляется ещё больше, выявляя слова, которые могут оказаться не в финальной версии ответа, но которые имеют значение для процесса генерации.
Как говорит Том МакГрат, главный ученый компании Goodfire, «J-lens даёт подсказки о том, о чём думает модель на разных уровнях». Это открытие позволило Anthropic сделать большой шаг в области механистической интерпретируемости, способствующей развитию более надежных и безопасных AI-систем.
Какая это представляет ценность
Для разработчиков и исследователей в области AI такой инструмент, как J-lens, является настоящим прорывом. Понимание внутренних процессов работы LLM может помочь в улучшении взаимодействия с ними и выявлении нежелательных паттернов. Это также подтверждает важность интерпретируемости AI в масштабе всей индустрии, что является важным аспектом как для пользователей, так и для регуляторов.
Следующими шагами для Anthropic будут дальнейшие тестирования J-lens и его интеграция в образовательные платформы, такие как Neuronpedia, для более широкого использования и экспериментов с LLM.