Назад к дайджесту
Reddit

ModelExpress: Распределение артефактов моделей со скоростью света

NVIDIA представила ModelExpress — сервис распределения весов и управления кэшем в рамках платформы Dynamo. Технология позволяет сократить время запуска модели DeepSeek-V4 Pro с 8 до 2 минут за счёт прямой передачи весов между GPU через RDMA, избегая централизованных трансляций. Подход ускоряет как инференс, так и пост-обучение с подкреплением.

score 55r/LocalLLaMA