Назад к дайджесту
Reddit

Сборка локальной ИИ-системы на двух картах Huawei Ascend: оптимизация Qwen3.8-flash-next и vLLM

Автор делится опытом развертывания модели Qwen3.8-flash-next на двух картах Huawei Atlas 300I Duo с общей памятью 192 ГБ. Статья описывает аппаратные особенности ускорителей, проблемы с производительностью на старте и методы их решения через доработку стека vLLM, кастомных операторов и управления памятью, что позволило достичь стабильных 30-61 токена в секунду.

score 40r/LocalLLaMA