Назад к дайджесту
Reddit

Обновления vLLM для Ascend: запуск GLM-5.3-Flash на двух картах Ascend 310P

Автор делится опытом оптимизации запуска MoE-модели GLM-5.3-Flash (320 млрд параметров) на двух GPU Ascend 910B/310P с использованием vLLM. Достигнута скорость генерации 8-9 токенов в секунду, реализована поддержка горячего обмена модулей и контекстного окна до 311 тысяч токенов.

score 40r/LocalLLaMA