Назад к дайджесту
Reddit

Преобразование плотных моделей в Mixture-of-Experts (MoE)

Автор делится опытом конвертации плотных LLM (Qwen2.5-0.5B и SmolLM2-360M) в разреженные модели архитектуры Mixture-of-Experts без предварительного обучения с нуля. Эксперимент показывает снижение вычислительных затрат на токен примерно на 40-50% при приемлемом падении качества по сравнению с исходными плотными моделями.

score 40r/LocalLLaMA