Reddit
Возвращаем производительность GPU Volta: оптимизация vLLM для V100
Разработан форк vLLM под названием 1Cat-vLLM, позволяющий эффективно обслуживать языковые модели на устаревших GPU NVIDIA V100. Приведены сравнительные тесты производительности модели Qwen3.6-35b, демонстрирующие, что при правильной оптимизации десятилетние видеокарты могут показывать достойные результаты.
score 40r/LocalLLaMA