Reddit
Оптимизации MoE в llama.cpp: резидентность экспертов, гибридное выполнение CPU/GPU и поддержка квантования Q2_0
Разработчик представил форк llama.cpp с поддержкой гибридного выполнения моделей MoE, распределяя нагрузку между CPU и GPU в зависимости от пропускной способности шины. Внедрены механизмы резидентности экспертов для удержания часто используемых частей модели в VRAM, что позволяет эффективнее использовать вычислительные мощности GPU при нехватке памяти. Также добавлена поддержка экстремального квантования Q2_0 для запуска сверхмалых моделей.
score 55r/LocalLLaMA