Reddit
Для Strix Halo: официальный llama.cpp не идеален — как достичь максимальной пропускной способности
Пользователь Reddit утверждает, что официальный llama.cpp не оптимизирован для Strix Halo (gfx1151) и достигает лишь 50% теоретической производительности. Он предлагает три альтернативных форка, которые значительно ускоряют работу: halogen-flash-server (около 50 токенов/с декодирование и 1200 токенов/с prefill), экспериментальный форк llama.cpp (почти 60 токенов/с декодирование) и strix-llama.cpp (около 30 токенов/с декодирование и 800 токенов/с prefill). Все они оптимизированы для модели Qwen 3.8 Flash Next и позволяют использовать железо эффективнее.
score 55r/LocalLLaMA