Назад к дайджесту
Reddit

Запуск Qwen3.8-Flash-Next (95.5 ГиБ) на Mac с 64 ГБ: ~27 ток/с, чекпоинт и форк

Автор запускает большую локальную модель Qwen3.8-Flash-Next (95.5 ГиБ) на Mac с 64 ГБ, используя экспертное стриминг с SSD. Оптимизации включают прямой файловый ввод, draft head, sparse attention и Metal MoE fusion, что даёт ~27 ток/с генерации и до 451 ток/с обработки промптов. Опубликованы чекпоинт на Hugging Face и форк llama.cpp с необходимыми флагами.

score 40r/LocalLLaMA