Reddit
Оптимальная настройка Qwen3.8 27B для видеокарты с 16 ГБ VRAM
Пользователь делится опытом запуска модели Qwen3.8 27B на GPU с 16 ГБ памяти (RTX 5060 Ti) с использованием llama.cpp. В обновлении указан конкретный квантованный GGUF-файл и параметры запуска, обеспечивающие скорость генерации около 35 токенов в секунду при контексте 128k.
score 40r/LocalLLaMA