Назад к дайджесту
Reddit

Запуск Qwen3.8-Flash-Next на Mac M3 Max с 64 ГБ памяти через oMLX

Пользователь успешно запустил модель Qwen3.8-Flash-Next-oQ4e-mtp объемом 99 ГБ на Mac M3 Max с 64 ГБ оперативной памяти, используя фреймворк oMLX. При настройках Lightning MTP и MoE Expert Offload достигнута скорость генерации 15.8 токенов в секунду и эффективность кэша 90.9% при контекстном окне до 130k токенов.

score 40r/LocalLLaMA