Назад к дайджесту
Reddit

Qwen3.8-Flash-Next на Strix Halo с контекстом 1M: 38 ток/с при декодировании, 18 минут префилл (halogen 0.12.0)

Разработчик halogen сообщает об исправлении деградации производительности на глубоком контексте. В версии 0.12.0 декодирование на 1M токенов ускорилось с 27.3 до 38.3 ток/с, а холодный префилл — с 21.2 до 17.9 минут. Тестирование проводилось на Ryzen AI Max+ 395 с 128 ГБ памяти.

score 40r/LocalLLaMA