Reddit
Преобразование плотных моделей в Mixture-of-Experts (MoE)
Автор делится опытом конвертации плотных LLM (Qwen2.5-0.5B и SmolLM2-360M) в разреженные модели архитектуры Mixture-of-Experts без предварительного обучения с нуля. Эксперимент показывает снижение вычислительных затрат на токен примерно на 40-50% при приемлемом падении качества по сравнению с исходными плотными моделями.
score 40r/LocalLLaMA