Назад к дайджесту
Reddit

Реализовал BatchNorm, LayerNorm и GroupNorm с нуля, чтобы понять их влияние на активации нейронов

Автор реализовал с нуля три популярных метода нормализации (BatchNorm, LayerNorm, GroupNorm) и сравнил их работу на простой MLP-сети для MNIST. Визуализация активаций показала, как нормализация устраняет «мёртвые» нейроны и меняет распределение выходов, повышая точность модели с 84% до 96%. Эксперимент подтвердил, что на данной задаче все три метода работают примерно одинаково, но позволил лучше понять их геометрическую природу и ограничения.

score 40r/MachineLearning