Reddit
MoE-модель на Mac mini: GPU простаивает 27% времени из-за загрузки экспертов с SSD
Пользователь оптимизирует запуск MoE-модели Qwen Flash на Mac Mini M4 с 64 ГБ памяти, используя потоковую передачу данных с SSD. Несмотря на кэширование и предсказательную выборку, GPU тратит 27% времени декодирования на ожидание загрузки экспертов, что ограничивает производительность.
score 40r/LocalLLaMA