Назад к дайджесту
Reddit

Qwen-3.8-Flash-Next на одной RTX 5090: TG=50 t/s, PP=2300 t/s с FreeToken

Пользователь запустил Qwen 3.8 Flash Next на одной RTX 5090 с помощью FreeToken и получил скорость генерации около 50 токенов/с и префилл 2300 токенов/с благодаря экспертному кэшированию. Он отмечает, что llama.cpp пока не поддерживает кэширование экспертов для MoE-моделей, а FreeToken позволяет эффективно использовать имеющееся железо. Проект ранний, но уже работает с другими MoE-моделями.

score 40r/LocalLLaMA