Назад к дайджесту
Reddit

GLM 5.3 Flash: ускорение декодирования на 50%+ для конфигураций с двумя NVIDIA DGX Spark

Автор тестирования сообщает о значительном улучшении производительности модели GLM 5.3 Flash после обновления рецепта развертывания: скорость декодирования выросла на 50–90%. Модель демонстрирует лучшие результаты по сравнению с DeepSeek v4.1 Flash на архитектуре Dual DGX Spark, сохраняя при этом высокое качество генерации и снижая потребление памяти KV-пула.

score 40r/LocalLLaMA