Назад к дайджесту
Reddit

llama.cpp: добавлен кэш GPU для экспертов MoE, хранящихся в памяти хоста

В проект llama.cpp внесено улучшение, позволяющее использовать кэш видеопамяти GPU для экспертов моделей с архитектурой Mixture of Experts (MoE), которые не помещаются целиком в VRAM. Это решение потенциально обеспечивает значительный прирост скорости инференса для таких моделей.

score 55r/LocalLLaMA