Reddit
Обновил бенчмарк с новым рецептом на основе vLLM для Qwen 3.8 Flash Next: теперь 98/100 (вместо 91)
Пользователь улучшил свой бенчмарк, перейдя на новую схему запуска Qwen 3.8 Flash Next: вместо весов NVFP4 с SGLANG теперь используются AWQ W4A16 и PLE (INT4) с патченным vLLM. Результат вырос с 91 до 98/100, хотя скорость снизилась. Автор планирует выяснить, что дало основной прирост — движок или квантование.
score 40r/LocalLLaMA