Назад к дайджесту
Reddit

Настройка приёма черновиков в MTP?

Пользователь спрашивает, как улучшить показатели Multi-Token Prediction (MTP) при запуске llama-server с моделью Qwen3.6-35B-A3B-MTP-UD-Q8_K_XL.gguf, приводя полную конфигурацию запуска с параметрами --spec-type draft-mtp и --spec-draft-n-max 5. Обсуждается, находится ли текущая производительность в ожидаемом диапазоне.

score 40r/LocalLLaMA