Reddit
llama.cpp: кэширование «горячих» MoE-экспертов на GPU даёт до 2x ускорения
Новый PR для llama.cpp (#26563) внедряет кэширование часто используемых экспертов MoE-моделей в VRAM, оставляя редко задействованные на CPU. На Qwen3.6-35B с 8GB VRAM зафиксирован прирост с 33 до 56 tok/s для Q2_M и с 17 до 36 tok/s для Q5_K_P, однако для некоторых моделей (Qwen3.5-122B, Laguna-S) оптимизация даёт обратный эффект.
score 70r/LocalLLaMA