Reddit
Зачем сохранять N входов для softmax, если можно использовать N-1?
Автор предлагает оптимизацию последнего слоя нейросети: вместо N логитов передавать в softmax только N-1 значений, вычисляя последнее как отрицательную сумму остальных. Это теоретически должно сократить количество параметров и немного ускорить сходимость модели за счет устранения избыточности, обусловленной условием нормировки вероятностей.
score 40r/MachineLearning