Reddit
Добавлена поддержка GLM-5-Flash MTP в llama.cpp
В репозиторий llama.cpp внесены изменения, позволяющие локально запускать модель GLM-5-Flash с использованием метода Multi-Token Prediction. Это расширение функционала фреймворка для инференса LLM.
score 55r/LocalLLaMA