Назад к дайджесту
Reddit

Qwen3.8-Flash-Next в llama.cpp, SGLang и FreeToken: от 35 до 258 секунд до первого токена при полном контексте. Мои выводы о новых PR в движках.

Пользователь протестировал модель Qwen3.8-Flash-Next на одной рабочей станции с тремя движками инференса: llama.cpp, SGLang и FreeToken. При полном окне контекста в 262K токенов время до первого токена составило 35.4 секунды в SGLang, 80.4 в FreeToken, 210.2 в llama.cpp с MTP и 258.4 в базовом llama.cpp, что даёт разницу в 7.3 раза. Также тестировались спекулятивное декодирование, пропатченные сборки и различные форматы весов; llama.cpp с MTP показал ускорение декодирования в 1.63-1.69 раза на коротких и средних контекстах, но при этом значительно уступал по времени запуска.

score 55r/LocalLLaMA