Reddit
Оптимизация LlamAmpere v0.4: высокая скорость генерации Qwen3.8 27B на RTX 3090
Разработчик представил версию 0.4 форка Llama.cpp LlamAmpere, обеспечивающего более 95 токенов в секунду при генерации 100K контекста для модели Qwen3.8 27B на одной видеокарте RTX 3090. Обновление включает оптимизации для формата EXL3 и улучшенную поддержку длинного контекста, превосходя по скорости другие варианты llama.cpp и конкурируя с vLLM.
score 40r/LocalLLaMA