Reddit
Qwen 3.6 27B Q5 на трёх 2080 Ti: 55 токенов в секунду с llama.cpp. Можно ли выжать больше?
Пользователь делится настройками запуска модели Qwen 3.6 27B в квантовании Q5 на трёх видеокартах GTX 2080 Ti с помощью llama.cpp, достигая скорости 55 токенов в секунду. В обсуждении рассматриваются параметры оптимизации, такие как flash-attn и распределение слоев по GPU, с целью повышения производительности.
score 55r/LocalLLaMA