Reddit
Сравнение квантований MXFP4, Q4_K_M и Q4_K_XL для модели GLM-4.7 на встроенной графике AMD Radeon 680M
Тестирование производительности модели GLM-4.7 (архитектура MoE ~30B параметров) на мини-ПК с AMD Ryzen 7 6800H и встроенным GPU Radeon 680M. Сравнение форматов квантования MXFP4, Q4_K_M и Q4_K_XL показывает, что MXFP4 обеспечивает максимальную скорость обработки промптов, но уступает в скорости генерации токенов по сравнению с Q4_K_XL.
score 40r/LocalLLaMA