Назад к дайджесту
Reddit

Экспертное выгрузка в оперативную память в vLLM: пост благодарности tcclaviger

Разработчик tcclaviger добавил в vLLM поддержку экспертной выгрузки в оперативную память (RAM offloading), что значительно упрощает запуск передовых моделей на локальных машинах. На примере запуска DeepSeek-V4-Flash-Vision-Exp на четырех видеокартах AMD R9700 показано, как новая функция делает доступными ресурсоемкие модели без необходимости в огромных объемах видеопамяти.

score 40r/LocalLLaMA