Reddit
DFlash на RTX 5090: как избежать 2.5x замедления Laguna S 2.1 и поднять скорость до 64 токенов в секунду
Автор протестировал DFlash speculative decoding для модели Laguna S 2.1 (118B MoE) на паре RTX 5090. По умолчанию функция замедлила генерацию в 2.5 раза из-за утечек в RAM и избыточной верификации. Настройка параметров --spec-draft-n-max и --spec-draft-p-min позволила поднять скорость с 23 до 64 токенов в секунду, хотя автор всё же предпочёл базовый режим.
score 40r/LocalLLaMA