Назад к дайджесту
Reddit

llama-halo-hybrid: гибридная конфигурация Strix Halo и R9700 обходит DGX Spark в инференсе LLM

Автор доработал проект llama-halo-hybrid, позволяющий распределять слои модели и KV-кэш между APU AMD Strix Halo и дискретной видеокартой (например, R9700) через PCIe или Thunderbolt. Решение на базе llama.cpp достигает скорости более 60 токенов в секунду при декодировании и превосходит по производительности систему DGX Spark при работе с моделями Qwen и GLM.

score 55r/LocalLLaMA