Исследователи разработали MeMo — модульную архитектуру, позволяющую командам обновлять свои языковые модели (LLM) без необходимости их переобучения и с улучшением производительности на 26%. Это важная новинка для компаний, которые сталкиваются с проблемами статического обновления знаний в моделях AI.
Проблемы современного LLM
Большинство современных LLM имеют статическую архитектуру, которая требует значительных вычислительных ресурсов и временных затрат для обновления знаний. На сегодняшний день разработчики используют три подхода для интеграции внешних данных:
- Непараметрические методы, такие как retrieval-augmented generation (RAG), ограничены размерами контекстного окна и неоправданно нагружают системы.
- Параметрические методы, например, дообучение, дорогостоящие и часто приводят к потере ранее усвоенных знаний.
- Методы латентной памяти предлагают компромисс, но их использование ограничено архитектурой используемой модели.
Как работает MeMo
Модель MeMo состоит из двух компонентов: MEMORY и EXECUTIVE. MEMORY — это малая языковая модель, специально обученная на клетке знаний. EXECUTIVE — это основная замороженная LLM, которая отвечает за процесс reasoning. При запросе пользователь отсылает вопрос в EXECUTIVE, который использует MEMORY для поиска фактов и формулировки ответа. Такой подход позволяет избежать катастрофического забывания, связанного с прямым дообучением.
Как отметил один из разработчиков, Армандо Солар-Лесама, «MeMo помогает обойти ограничения традиционных методов, увеличивая точность и снижая время отклика». Исследования показывают, что система эффективно обрабатывает даже сложные запросы, минимизируя влияние шумов в данных.
Практическое значение для компаний
Для русскоязычных компаний использование MeMo может существенно упростить процесс управления LLM и сократить затраты. С ростом производительности на 26% компании смогут обновлять свои модели более эффективно, предотвращая снижение качества ответов при добавлении новых данных.
Следующий этап — тестирование MeMo в коммерческих проектах, где его эффективность может быть проверена на реальных данных и в системах с высоким уровнем нагрузок.