Reddit
Я запускаю модели 35B–480B на MacBook с 36 ГБ ОЗУ, стримя MoE-эксперты с SSD — собственное приложение и честные бенчмарки
Разработчик форкнул llama.cpp для стриминга весов MoE-экспертов с SSD, позволяя запускать модели до 480B на MacBook с 36 ГБ ОЗУ без свопинга. В публикации приведены реальные бенчмарки скорости генерации и честный разбор неудачных экспериментов, включая отказ от дублирования SSD и предсказательного кэширования.
score 40r/LocalLLaMA