Назад к дайджесту
Reddit

Оптимизация LlamAmpere v0.4: высокая скорость генерации Qwen3.8 27B на RTX 3090

Разработчик представил версию 0.4 форка Llama.cpp LlamAmpere, обеспечивающего более 95 токенов в секунду при генерации 100K контекста для модели Qwen3.8 27B на одной видеокарте RTX 3090. Обновление включает оптимизации для формата EXL3 и улучшенную поддержку длинного контекста, превосходя по скорости другие варианты llama.cpp и конкурируя с vLLM.

score 40r/LocalLLaMA