Новость
DeepSeek на DGX Spark: разгон до 68 tok/s и анализ производительности
Автор тестирует модель DeepSeek на связке из двух NVIDIA DGX Spark, добившись 67.6 tok/s на одиночном запросе и 260 tok/s на 12 параллельных. Ключевые улучшения получены за счёт обновления vLLM с 0.21.1 до 0.25.2 (+22%) и явного включения MoE-бэкенда flashinfer_b12x (+13-16%).