Назад к дайджесту
Reddit

Протестировали все методы спекулятивного декодирования на Qwen3.6-27B в vLLM и SGLang

Автор провёл детальный бенчмарк методов спекулятивного декодирования (DFlash, MTP, EAGLE3, ngram) для модели Qwen3.6-27B на видеокарте RTX PRO 6000 Max-Q. DFlash показал лучший результат с ускорением до 3.3x в SGLang, в то время как EAGLE3 столкнулся с проблемами совместимости в vLLM. Материал полезен для инженеров, оптимизирующих инференс LLM.

score 40r/LocalLLaMA