Команда Kimi представила новое решение для нейросетей — Attention Residuals, которое повышает эффективность языковых моделей (LLM), заменяя традиционные остаточные соединения на механизм внимания. Это решение позволяет более эффективно обрабатывать информацию на различных уровнях слоев модели.
Проблемы стандартных LLM
Текущие нейросети, использующие стандартные остаточные соединения, сталкиваются с проблемами накопления выходов слоев, что приводит к снижению их эффективности при увеличении глубины модели. Attention Residuals решает эту проблему с помощью механизма softmax-внимания, который позволяет каждому слою избирательно агрегаировать представления предыдущих слоев с обучаемыми весами, зависящими от входных данных.
Эксперименты и результаты
Для уменьшения потребления памяти и затрат на связь команда предлагает Block AttnRes, который разбивает слои на блоки и обрабатывает их на уровне представлений. Этот подход сохраняет преимущества полного Attention Residuals, но требует меньше ресурсов для вычислений. В экспериментах с масштабированием показано, что такой подход обеспечивает стабильное улучшение по сравнению с традиционными методами.
Модель Kimi Linear, включающая новейшую технологию, была предобучена на 1,4 триллионах токенов, что улучшает распределение градиентов. Результаты демонстрируют улучшение производительности по всем оцененным задачам. Инженеры и исследователи, работающие с нейросетями, могут применять эти новые технологии в своих проектах, улучшая качество и скорость обработки данных.
В дальнейшем ожидается активное применение Attention Residuals в других архитектурах и расширение использования в спектре задач, связанных с обработкой естественного языка.