Reddit
Локальный запуск LLM на кластере из 4 плат BC-250: 70 токенов/с с контекстом 100k или 145 токенов/с с двумя моделями Qwen 3.6 35B
Автор делится опытом развертывания кластера из четырех отладочных плат AMD BC-250 для локального инференса больших языковых моделей. С использованием llama.cpp, Vulkan и RPC удалось достичь производительности около 70 токенов в секунду при контексте 100k токенов или 145 токенов в секунду при запуске двух экземпляров модели Qwen 3.6 35B с контекстом 256k. В тексте также описаны затраты на оборудование, энергопотребление и проблемы с тепловыделением.
score 40r/LocalLLaMA