Reddit
Оптимизация локального запуска LLM на системе из 4 видеокарт RTX 3060 Ti
Автор делится опытом развертывания моделей Qwen3.8-27B на конфигурации из четырех видеокарт RTX 3060 Ti с использованием техник тензорного параллелизма. Применение фреймворков Exl3 и vLLM с квантованием KV-буфера позволило достичь скорости генерации до 120 токенов в секунду при контексте 150k и поддерживать высокую параллельную обработку запросов.
score 40r/LocalLLaMA