Назад к дайджесту
Reddit

Qwen3.8-Flash-Next на RTX 5090: 150-200 токенов/с при декодировании и 5-6k токенов/с при префилле

Пользователь поделился результатами тестирования модели Qwen3.8-Flash-Next на конфигурации с RTX 5090 и 96 ГБ DDR5-6400. При использовании квантования IQ3_S и контексте 128k токенов (8-бит) модель демонстрирует скорость декодирования 150-200 токенов в секунду и скорость префиллинга 5-6 тысяч токенов в секунду.

score 40r/LocalLLaMA