Reddit
Использование двух GPU для vLLM: ресурсы для 50+ и 40 видеокарт Nvidia
Автор поделился собственным решением для распределения ресурсов vLLM, позволяющим эффективно использовать до 50 и 40 видеокарт Nvidia. Проект размещен на GitHub и направлен на оптимизацию работы с ограничением ресурсов при запуске больших языковых моделей.
score 55r/LocalLLaMA