Назад к дайджесту
Reddit

Оптимизация локального запуска LLM на системе из 4 видеокарт RTX 3060 Ti

Автор делится опытом развертывания моделей Qwen3.8-27B на конфигурации из четырех видеокарт RTX 3060 Ti с использованием техник тензорного параллелизма. Применение фреймворков Exl3 и vLLM с квантованием KV-буфера позволило достичь скорости генерации до 120 токенов в секунду при контексте 150k и поддерживать высокую параллельную обработку запросов.

score 40r/LocalLLaMA