Reddit
GLM 5.3 Flash Q4: 60 токенов/с на M3 Ultra, 550 токенов/с при префилле
Пользователь оптимизировал запуск модели GLM 5.3 Flash на чипе M3 Ultra, добившись значительного ускорения инференса. Благодаря фьюжну мелких GPU-ядер и замене алгоритма поиска контекста удалось повысить скорость с 29 до 40 токенов/с на коротком контексте и с 21.6 до 37.4 токенов/с на длинном (300k). В заголовке указаны пиковые значения: 60 токенов/с при генерации SQL и 550 токенов/с на этапе префилла.
score 40r/LocalLLaMA