Назад к дайджесту
Reddit

Запуск модели DeepSeek-V4-Flash-0731 (155 ГБ MoE) на DGX Spark с 2-битной квантовкой через vLLM-Moet

Пользователь делится опытом запуска 155-гигабайтной MoE-модели DeepSeek-V4-Flash-0731 на сервере DGX Spark с использованием библиотеки vLLM-Moet и 2-битной квантования. В материале описаны технические нюансы сборки под ARM64, обходные пути для поддержки GPU sm_121 и результаты тестов производительности с ускорением префилла до 31.5%.

score 40r/LocalLLaMA