Reddit
Спекулятивное декодирование Qwen3.6-27B эффективнее на более тяжелых квантованиях
Автор протестировал Qwen3.6-27B с разными алгоритмами спекулятивного декодирования и уровнями квантования, выяснив, что более тяжёлые квантования (Q8) дают больший прирост скорости. DFlash показал наилучшие результаты среди алгоритмов, а Weaver оказался уникальным решением для конкретных сценариев. Исследование также выявило аномалии в llama.cpp и ограничения спекулятивного декодирования при высокой конкуренции.
score 40r/LocalLLaMA