Reddit
Экспертное IQ3-квантование DeepSeek-V4-Flash-0731: лучше KLD, чем UD-IQ3_S, ускорение декодирования в 1.4x при выгрузке в CPU
Выполнено экспертное IQ3-квантование модели DeepSeek-V4-Flash-0731: изменена точность только routed expert tensors, остальные слои сохранены. Сравнение с UD-IQ3_S показало лучшее качество (KLD 0.2386 vs 0.2936) и прирост скорости декодирования в 1.4 раза на гибридной GPU-CPU конфигурации. Это решение оптимизирует использование памяти для моделей с выгрузкой экспертов в оперативную память без перехода на Q2.
score 40r/LocalLLaMA