Назад к дайджесту
Reddit

Qwen3.5 0.8B на CPU: новый движок и квантование

Автор протестировал скорость работы модели Qwen3.5 0.8B на CPU, создав собственный C++ движок и формат квантования H128/Q4-G32-DOT4. По сравнению с llama.cpp и Unsloth Q4_0, новый движок показывает до 2.9× ускорение префилла и 1.7× пропускную способность при batch=16, сохраняя сопоставимые метрики качества.

score 40r/LocalLLaMA