Reddit
ModelExpress: Распределение артефактов моделей со скоростью света
NVIDIA представила ModelExpress — сервис распределения весов и управления кэшем в рамках платформы Dynamo. Технология позволяет сократить время запуска модели DeepSeek-V4 Pro с 8 до 2 минут за счёт прямой передачи весов между GPU через RDMA, избегая централизованных трансляций. Подход ускоряет как инференс, так и пост-обучение с подкреплением.
score 55r/LocalLLaMA