Reddit
Swift 1.5 на veloGB10: ~110 токенов/с на 2× DGX Spark, xhigh обходит базовый Flash-Next на vLLM
Автор тестирует reasoning-efficient форк Swift 1.5 (на базе Qwen3.8-Flash-Next) с использованием EXL3-квантования на движке veloGB10 для NVIDIA GB10. На конфигурации из двух DGX Spark достигается скорость декодирования около 110 токенов в секунду, что позволяет запускать агентов на высоком уровне усилий (xhigh) быстрее, чем базовая модель на средних настройках через vLLM. Тестирование проводилось на задачах программирования с использованием агента Claude Code.
score 40r/LocalLLaMA