Reddit
llama-halo-hybrid: гибридная конфигурация Strix Halo и R9700 обходит DGX Spark в инференсе LLM
Автор доработал проект llama-halo-hybrid, позволяющий распределять слои модели и KV-кэш между APU AMD Strix Halo и дискретной видеокартой (например, R9700) через PCIe или Thunderbolt. Решение на базе llama.cpp достигает скорости более 60 токенов в секунду при декодировании и превосходит по производительности систему DGX Spark при работе с моделями Qwen и GLM.
score 55r/LocalLLaMA