Назад к дайджесту
Reddit

exllamav3 уверенно обходит llama.cpp при CPU-offloaded инференсе Qwen-3.8-Flash-Next на моей системе!

Пользователь Reddit сравнил производительность exllamav3 и llama.cpp при CPU-offloaded инференсе модели Qwen-3.8-Flash-Next на системе с 2x RTX 3080 и Xeon. exllamav3 показал 3.2x более быстрый prefill и 2x более быстрый decode, а также лучшее качество вывода благодаря более эффективному квантованию EXL3. Однако преимущество не универсально: на модели GLM 5.3 Flash exllamav3 оказался в 2 раза медленнее, что указывает на зависимость от архитектуры модели и конфигурации системы.

score 55r/LocalLLaMA