Reddit
LayerStoRm: открытый движок потокового вывода экспертов — GLM-5.3-Flash с контекстом 1M на 2× RTX 5090 + 2× RTX 5080
Представлен LayerStoRm — экспериментальный open-source движок (MIT-лицензия) для инференса MoE-моделей, размер которых превышает объём VRAM. Он удерживает экспертов в оперативной памяти хоста и подгружает их по токенам, что позволяет запускать модель GLM-5.3-Flash (186 GiB) на 96 ГБ VRAM, достигая 24.5 ток/с при декодировании и 159 ток/с при префилле. Движок оптимизирован для агентного программирования: поддерживает кэширование префиксов с контрольными точками, сокращая TTFT при повторном префилле, и работает на NVIDIA SM120.
score 55r/LocalLLaMA