Reddit
Запуск GLM 5.3 Flash на M5 Ultra: 68.8 токенов в секунду
Пользователь поделился результатами бенчмарка модели GLM 5.3 Flash, запущенной на аппаратной платформе M5 Ultra. При использовании оптимизации oQ4e+MTP и фреймворка oMLX 0.7.0 достигнута скорость генерации 68.8 токенов в секунду при объеме префилла в 1878 токенов.
score 40r/LocalLLaMA