Reddit
Tauon: новый оптимизатор, превосходящий Muon по скорости и точности на GPT-Mini
Разработчик представил новый оптимизатор Tauon, использующий полиномы и ортогонализацию для снижения количества шагов и размера матриц. В бенчмарках на модели GPT-Mini он показал более низкую ошибку валидации и на 8.5% более быстрое время одного шага по сравнению с Muon, сохраняя стабильность обучения лучше, чем AdamW.
score 40r/MachineLearning