Назад к дайджесту
Reddit

Внимание: llama.cpp теперь загружает MTP-тензоры по умолчанию для архитектур draft-mtp, даже если MTP отключен

Недавние сборки llama.cpp теперь автоматически загружают MTP/NextN тензоры из GGUF-файлов, даже если режим спекулятивного декодирования не активирован. Это затрагивает модели вроде GLM-5.2 и Qwen35MoE, приводя к дополнительному расходу VRAM/RAM примерно на один слой MoE при каждой загрузке.

score 55r/LocalLLaMA