Reddit
GLM-5.2 Q4 на кластере из 16 видеокарт AMD MI50: 12.2 ток/с через llama.cpp RPC
Пользователь запустил квантованную модель GLM-5.2 на кластере из 16 видеокарт AMD MI50, используя RPC-интерфейс llama.cpp. На контексте 10.7k токенов скорость генерации достигла 12.2 токена в секунду, превзойдя результаты предыдущих попыток с vLLM. Тест подтвердил стабильность работы при распределении VRAM между двумя узлами.
score 55r/LocalLLaMA