Reddit
llama.cpp: добавлен кэш GPU для экспертов MoE, хранящихся в памяти хоста
В проект llama.cpp внесено улучшение, позволяющее использовать кэш видеопамяти GPU для экспертов моделей с архитектурой Mixture of Experts (MoE), которые не помещаются целиком в VRAM. Это решение потенциально обеспечивает значительный прирост скорости инференса для таких моделей.
score 55r/LocalLLaMA