AI И НЕЙРОСЕТИ

Команда Kimi представила Attention Residuals для оптимизации LLM

Технология Attention Residuals от Kimi улучшает нейросети, обеспечивая эффективное обучение языковых моделей.

✍️ Редакция iTech News | 17.03.2026 | ⏱ 2 мин | 👁 10 | Источник: Reddit r/MachineLearning
🤖

Команда Kimi представила новое решение для нейросетей — Attention Residuals, которое повышает эффективность языковых моделей (LLM), заменяя традиционные остаточные соединения на механизм внимания. Это решение позволяет более эффективно обрабатывать информацию на различных уровнях слоев модели.

Проблемы стандартных LLM

Текущие нейросети, использующие стандартные остаточные соединения, сталкиваются с проблемами накопления выходов слоев, что приводит к снижению их эффективности при увеличении глубины модели. Attention Residuals решает эту проблему с помощью механизма softmax-внимания, который позволяет каждому слою избирательно агрегаировать представления предыдущих слоев с обучаемыми весами, зависящими от входных данных.

Эксперименты и результаты

Для уменьшения потребления памяти и затрат на связь команда предлагает Block AttnRes, который разбивает слои на блоки и обрабатывает их на уровне представлений. Этот подход сохраняет преимущества полного Attention Residuals, но требует меньше ресурсов для вычислений. В экспериментах с масштабированием показано, что такой подход обеспечивает стабильное улучшение по сравнению с традиционными методами.

Модель Kimi Linear, включающая новейшую технологию, была предобучена на 1,4 триллионах токенов, что улучшает распределение градиентов. Результаты демонстрируют улучшение производительности по всем оцененным задачам. Инженеры и исследователи, работающие с нейросетями, могут применять эти новые технологии в своих проектах, улучшая качество и скорость обработки данных.

В дальнейшем ожидается активное применение Attention Residuals в других архитектурах и расширение использования в спектре задач, связанных с обработкой естественного языка.

Поделиться: Telegram X LinkedIn