Reddit
Движок Strata для инференса Qwen3.8 Flash Next: 50 токенов/с на ноутбуке с 12 ГБ VRAM
Разработчик представил новый движок инференса Strata, демонстрирующий высокую скорость генерации (50 t/s) и чтения контекста (1500 t/s) для модели Qwen3.8 Flash Next в квантовании GGUF. Решение работает на Nvidia GPU и значительно превосходит по производительности стандартный llama.cpp, позволяя запускать передовые модели локально на ноутбуках с ограниченным объемом видеопамяти.
score 40r/LocalLLaMA