Reddit
Qwen3.8-Flash-Next на двух 3090: ускорение декодирования на 9–12% при контексте ~119k токенов с пройденной проверкой качества
Пользователь сообщает об улучшении производительности Qwen3.8-Flash-Next на связке из двух RTX 3090: замена CUDA top-k fallback на radix-selection в llama.cpp ускорила медианную скорость декодирования с 30.2 до 33.3 токенов/с (на 9–12%) на длинных документах (~119k токенов контекста). Изменение основано на PR #28366 от Rhonstin и сокращает время выполнения top-k ядра с ~5.1 мс до 0.25 мс на токен. Качество генерации проверено при продакшн-сэмплинге с включённым MTP-3.
score 40r/LocalLLaMA