Reddit
Реализовал BatchNorm, LayerNorm и GroupNorm с нуля, чтобы понять их влияние на активации нейронов
Автор реализовал с нуля три популярных метода нормализации (BatchNorm, LayerNorm, GroupNorm) и сравнил их работу на простой MLP-сети для MNIST. Визуализация активаций показала, как нормализация устраняет «мёртвые» нейроны и меняет распределение выходов, повышая точность модели с 84% до 96%. Эксперимент подтвердил, что на данной задаче все три метода работают примерно одинаково, но позволил лучше понять их геометрическую природу и ограничения.
score 40r/MachineLearning