Назад к дайджесту
Reddit

Как раскрыть потенциал MTP

Автор провёл бенчмарки оптимизации параметров MTP для различных LLM (Gemma, Qwen) на GPU (P100, V100). Выяснилось, что настройки по умолчанию оставляют значительный запас производительности, а правильная настройка n_max может дать прирост до 100%. Результаты и скрипты доступны на GitHub.

score 40r/LocalLLaMA