Reddit
Qwen3.8-Flash-Next (UD-Q4_K_XL) на одной RTX 3090 24GB + 128GB DDR4: оптимальна ли такая конфигурация?
Пользователь делится опытом запуска модели Qwen3.8-Flash-Next (квантование UD-Q4_K_XL) на системе с RTX 3090 24GB и 128GB DDR4, используя llama.cpp. Приводит детальную конфигурацию запуска, включая offload всех слоёв на GPU, принудительное размещение 42 MoE-слоёв на CPU/RAM и контекст 200k токенов. Сообщает о стабильной скорости генерации ~15.5-16 ток/с и скорости обработки промпта ~185-190 ток/с, спрашивая сообщество об оптимальности данной настройки.
score 40r/LocalLLaMA