AI И НЕЙРОСЕТИ

Исследование: Как неправильный шаг градиентного спуска влияет на нормализацию

Новое исследование выявляет проблемы градиентного спуска в контексте глубокого обучения и его влияние на нормализацию в нейронных сетях.

✍️ Редакция iTech News | 18.03.2026 | ⏱ 2 мин | 👁 1 | Источник: Reddit r/MachineLearning
🧬

Недавнее исследование, представленное на семинаре GRaM в ICLR, ставит под сомнение, насколько корректно градиентный спуск движется в пространстве активаций в контексте глубокого обучения. Специалисты обнаружили, что параметры действительно следуют по наиболее крутой траектории спуска, а активации — нет.

Работа предлагает математическое подтверждение этого с помощью простых аффинных слоев, сверток и механизма внимания. Основное внимание уделяется поиску решений, которые могут дать новое механистическое объяснение значимости нормализации. В результате были выявлены два структурно отличающихся метода: существующие нормализаторы (такие как L2/RMS) и новая форма полносвязного слоя.

Новые методы нормализации в глубоких нейронных сетях

Разработан новый тип аффинного слоя с встроенной нормализацией, который сохраняет степени свободы, что отличает его от стандартных нормализаторов. Также предложен новый класс нормализаторов под названием "PatchNorm" для свёрточных нейронных сетей, который открывает новые горизонты для эмпирического поиска.

Эмпирические результаты и их значение

Эмпирические результаты показывают, что это новое решение не инвариантно к масштабу и не является нормализатором, однако оно стабильно повторяет или превосходит BatchNorm и LayerNorm в контролируемых тестах MLP. Это подтверждает, что инвариантность к масштабу не является главным механизмом действия, а возможно, здесь замешана неправильно выстроенная логика.

Для разработчиков эта работа может предложить новые идеи для построения нейронных сетей. К примеру, использование нового аффинного слоя и нормализаторов может значительно улучшить результаты в задачах глубокого обучения, особенно когда речь идет о свёрточных сетях.

Следующие шаги в исследовании

Авторы исследования прогнозируют, что увеличение размера batch может негативно сказаться на производительности для слоев, корректирующих расхождения, что требует дальнейших эмпирических исследований.

Поделиться: Telegram X LinkedIn