Reddit
Какие настройки вы используете для запуска Qwen3.8-Flash-Next в llama.cpp?
Пользователь делится конфигурацией для запуска модели Qwen3.8-Flash-Next в llama.cpp на системе с 96 ГБ VRAM (3x AMD MI50) и 512 ГБ RAM, интересуясь, как другие оптимизируют параметры, особенно оффлоад эмбеддингов. Он приводит свои рабочие настройки (Q4_K_XL квантование, flash-attn, fit-ctx 262144) и скорость: 15 t/s на генерации и 100-200 t/s на предзаполнении при контексте 130000. Обсуждается сравнение ROCm и Vulkan.
score 55r/LocalLLaMA