Reddit
Запуск GLM-5.3-Flash на двух GPU CMP 170HX: 384K контекст и скорость ~90 токенов/с
Автор поделился стабильной конфигурацией для запуска MoE-модели GLM-5.3-Flash (18B активных параметров) на двух видеокартах NVIDIA CMP 170HX с использованием квантования EXL3. В тестировании сравнивались скорость инференса и выполнение задач на DSH с аналогичной настройкой Qwen3.8, при этом веса модели полностью размещены в HBM для максимизации производительности.
score 40r/LocalLLaMA