Reddit
llama.cpp: поддержка спекулятивного декодирования NextN/MTP для GLM-5.2
В репозиторий llama.cpp успешно добавлена поддержка алгоритмов NextN и MTP для спекулятивного декодирования моделей GLM-5.2 от Zhipu AI. Обновление позволяет существенно ускорить генерацию текста при локальном запуске без потери качества. Это важный шаг для оптимизации производительности LLM в рамках популярной C++ библиотеки.
score 40r/LocalLLaMA