Reddit
Протестировали все методы спекулятивного декодирования на Qwen3.6-27B в vLLM и SGLang
Автор провёл детальный бенчмарк методов спекулятивного декодирования (DFlash, MTP, EAGLE3, ngram) для модели Qwen3.6-27B на видеокарте RTX PRO 6000 Max-Q. DFlash показал лучший результат с ускорением до 3.3x в SGLang, в то время как EAGLE3 столкнулся с проблемами совместимости в vLLM. Материал полезен для инженеров, оптимизирующих инференс LLM.
score 40r/LocalLLaMA