Назад к дайджесту
Reddit

Движок Strata для инференса Qwen3.8 Flash Next: 50 токенов/с на ноутбуке с 12 ГБ VRAM

Разработчик представил новый движок инференса Strata, демонстрирующий высокую скорость генерации (50 t/s) и чтения контекста (1500 t/s) для модели Qwen3.8 Flash Next в квантовании GGUF. Решение работает на Nvidia GPU и значительно превосходит по производительности стандартный llama.cpp, позволяя запускать передовые модели локально на ноутбуках с ограниченным объемом видеопамяти.

score 40r/LocalLLaMA