Reddit
Обновление: Qwen3.8-Flash-Next на 2x3090 + DDR4 (часть 2): 25-29 → 37-41 токенов/с декодирование (UD-Q4_K_XL + экспертный кэш + MTP), плюс ветка для сборки
Продолжение эксперимента по запуску Qwen3.8-Flash-Next на двух RTX 3090 с DDR4. Переход на квант UD-Q4_K_XL позволил увеличить число слотов экспертного кэша до 188, что повысило hit rate до 90-92% и скорость декодирования до 32-35 токенов/с. Добавление MTP (multi-token prediction) поверх кэша дало ещё +5-6 токенов/с, достигнув 37-41 токенов/с. Также исправлены баги в кэше и проблема с тепловым троттлингом RAM.
score 40r/LocalLLaMA