Назад к дайджесту
Reddit

Двойной 7900 XTX: оптимизированный форк llama.cpp для этой конфигурации — Qwen 3.8 Q8 на 82 токена/сек при декодировании

Пользователь поделился форком llama.cpp, оптимизированным под две видеокарты Radeon RX 7900 XTX. На этой системе модель Qwen 3.8 в квантовании Q8 декодируется со скоростью около 82 токенов в секунду при контексте 60k, что значительно быстрее стандартной сборки с Vulkan (примерно 28 ток/с).

score 40r/LocalLLaMA