Reddit
Работа над MTP для Qwen Flash Next возобновлена
Разработчики llama.cpp возобновили работу над поддержкой Multi-Token Prediction (MTP) для модели Qwen Flash Next. Доступны новые квантованные версии GGUF от организации ggml-org, а соответствующий пул-реквест уже отправлен в репозиторий llama.cpp, хотя статус разработки остается рабочим (WIP).
score 40r/LocalLLaMA