Назад к дайджесту
Reddit

Использование двух GPU для vLLM: ресурсы для 50+ и 40 видеокарт Nvidia

Автор поделился собственным решением для распределения ресурсов vLLM, позволяющим эффективно использовать до 50 и 40 видеокарт Nvidia. Проект размещен на GitHub и направлен на оптимизацию работы с ограничением ресурсов при запуске больших языковых моделей.

score 55r/LocalLLaMA