Reddit
Qwen3.5 0.8B на CPU: новый движок и квантование
Автор протестировал скорость работы модели Qwen3.5 0.8B на CPU, создав собственный C++ движок и формат квантования H128/Q4-G32-DOT4. По сравнению с llama.cpp и Unsloth Q4_0, новый движок показывает до 2.9× ускорение префилла и 1.7× пропускную способность при batch=16, сохраняя сопоставимые метрики качества.
score 40r/LocalLLaMA