Reddit
Как раскрыть потенциал MTP
Автор провёл бенчмарки оптимизации параметров MTP для различных LLM (Gemma, Qwen) на GPU (P100, V100). Выяснилось, что настройки по умолчанию оставляют значительный запас производительности, а правильная настройка n_max может дать прирост до 100%. Результаты и скрипты доступны на GitHub.
score 40r/LocalLLaMA