Назад к дайджесту
Reddit

Добавлена поддержка GLM-5-Flash MTP в llama.cpp

В репозиторий llama.cpp внесены изменения, позволяющие локально запускать модель GLM-5-Flash с использованием метода Multi-Token Prediction. Это расширение функционала фреймворка для инференса LLM.

score 55r/LocalLLaMA