Reddit
Запуск Qwen 3.8 27B с контекстом 100K на видеокарте AMD RX 7800 XT (16 ГБ)
Автор делится настройкой запуска модели Qwen 3.8 27B в квантовании Q4 на GPU AMD с 16 ГБ видеопамяти через llama.cpp и Vulkan. Конфигурация позволяет обрабатывать контекст до 100 тысяч токенов с использованием оптимизаций кэша KV и достигает скорости генерации около 30 токенов в секунду.
score 40r/LocalLLaMA