Назад к дайджесту
Reddit

Qwen 3.6 27B Q5 на трёх 2080 Ti: 55 токенов в секунду с llama.cpp. Можно ли выжать больше?

Пользователь делится настройками запуска модели Qwen 3.6 27B в квантовании Q5 на трёх видеокартах GTX 2080 Ti с помощью llama.cpp, достигая скорости 55 токенов в секунду. В обсуждении рассматриваются параметры оптимизации, такие как flash-attn и распределение слоев по GPU, с целью повышения производительности.

score 55r/LocalLLaMA