Reddit
Бенчмарк CPU-оффлоада для MoE-моделей: TensorSharp против llama.cpp
TensorSharp внедрил функцию CPU-оффлоада для экспертных весов в MoE-архитектурах, позволяя запускать модели уровня 35B на видеокартах с 12-16 ГБ памяти. Бенчмарки на Gemma 4, Qwen и других моделях показывают сравнение производительности и потребления VRAM с llama.cpp при вынесении части слоёв в системную память.
score 55r/LocalLLaMA