Reddit
Запуск Qwen 3.8 Flash Next (125B MoE) на RTX 3060: оптимизация без потери качества
Автор делится опытом запуска 68-гигабайтной квантованной модели Qwen 3.8 Flash Next с архитектурой MoE на слабом железе (RTX 3060 12GB + 16GB RAM). В отличие от предыдущих попыток, он отказался от агрессивного отсечения экспертов ради точности, достигнув стабильных 21 токена в секунду с использованием llama.cpp и CUDA.
score 40r/LocalLLaMA