Reddit
Vulkan: реализация int8 coopmat1 matmul для AMD RDNA3 и RDNA4 в llama.cpp
В llama.cpp добавлена реализация int8 coopmat1 matmul для GPU AMD RDNA3/RDNA4, что значительно ускоряет инференс LLM. На Radeon 7900XTX с моделью gemma4 26B.A4B Q4_0 скорость обработки промпта (pp512) выросла с ~3410 до ~4331 t/s, а генерация (tg128) — с ~135.6 до ~142.8 t/s. Это заметный прирост производительности для локального запуска LLM на AMD.
score 55r/LocalLLaMA