Reddit
Qwen3.8-Flash-Next: 256K контекст, 16 ток/с на DDR4 и Tesla T4
Пользователь протестировал модель Qwen3.8-Flash-Next на сервере Dell R740 с Tesla T4 и 384GB DDR4, используя ik_llama.cpp с поддержкой MoE. Благодаря размещению всех экспертов в оперативной памяти и квантованию KV-кэша удалось достичь генерации 16-17 ток/с при полном контексте 256K, что значительно быстрее, чем у DeepSeek на том же железе. Модель показала хорошие результаты в кодинге и стала менее многословной по сравнению с Opus.
score 40r/LocalLLaMA