Назад к дайджесту
Reddit

Tauon: новый оптимизатор, превосходящий Muon по скорости и точности на GPT-Mini

Разработчик представил новый оптимизатор Tauon, использующий полиномы и ортогонализацию для снижения количества шагов и размера матриц. В бенчмарках на модели GPT-Mini он показал более низкую ошибку валидации и на 8.5% более быстрое время одного шага по сравнению с Muon, сохраняя стабильность обучения лучше, чем AdamW.

score 40r/MachineLearning