Reddit
Qwen4Exp: добавление MTP в llama.cpp
Разработчик am17an добавил поддержку Multi-Token Prediction (MTP) в проект llama.cpp для моделей Qwen Flash Next. Это позволяет ускорить генерацию текста при использовании квантованных версий моделей Qwen, опубликованных на Hugging Face.
score 55r/LocalLLaMA