Назад к дайджесту
Reddit

Я запускаю модели 35B–480B на MacBook с 36 ГБ ОЗУ, стримя MoE-эксперты с SSD — собственное приложение и честные бенчмарки

Разработчик форкнул llama.cpp для стриминга весов MoE-экспертов с SSD, позволяя запускать модели до 480B на MacBook с 36 ГБ ОЗУ без свопинга. В публикации приведены реальные бенчмарки скорости генерации и честный разбор неудачных экспериментов, включая отказ от дублирования SSD и предсказательного кэширования.

score 40r/LocalLLaMA