Reddit
Двойной 7900 XTX: оптимизированный форк llama.cpp для этой конфигурации — Qwen 3.8 Q8 на 82 токена/сек при декодировании
Пользователь поделился форком llama.cpp, оптимизированным под две видеокарты Radeon RX 7900 XTX. На этой системе модель Qwen 3.8 в квантовании Q8 декодируется со скоростью около 82 токенов в секунду при контексте 60k, что значительно быстрее стандартной сборки с Vulkan (примерно 28 ток/с).
score 40r/LocalLLaMA