Reddit
Оптимизация DSv4-Flash для двух GH200: 10 000 токенов/с при префилле, >300 токенов/с при генерации на SGLang
Энтузиаст поделился результатами оптимизации инференса модели DeepSeek V4 Flash на системе с двумя чипами NVIDIA GH200. С использованием патчей для vLLM и фреймворка SGLang удалось достичь производительности до 317 токенов/с при генерации и обработки контекста в 1M токенов на 192 ГБ памяти HBM.
score 40r/LocalLLaMA