Назад к дайджесту
Reddit

Возвращаем производительность GPU Volta: оптимизация vLLM для V100

Разработан форк vLLM под названием 1Cat-vLLM, позволяющий эффективно обслуживать языковые модели на устаревших GPU NVIDIA V100. Приведены сравнительные тесты производительности модели Qwen3.6-35b, демонстрирующие, что при правильной оптимизации десятилетние видеокарты могут показывать достойные результаты.

score 40r/LocalLLaMA