Назад к дайджесту
Reddit

Qwen 3.8 Flash Next: квантование q4_k_m, контекст 130k, кэш q8 на 16 ГБ VRAM и 64 ГБ RAM, 15-20 ток/с на RTX 4080

Автор делится опытом запуска Qwen 3.8 Flash Next на 16 ГБ VRAM с квантованием Q4_K_M, контекстом 130k и кэшем q8. Ключевой трюк — использование MTP-головы и флага --spec-draft-cpu-moe, который размещает draft-экспертов в RAM, освобождая GPU для целевых экспертов. Скорость достигает 15-20 ток/с на RTX 4080.

score 40r/LocalLLaMA