Назад к дайджесту
Reddit

Бенчмарки квантования KV-кэша: KVarN обгоняет q8_0, 413 конфигураций на Qwen и Gemma

Масштабное тестирование 413 конфигураций квантования KV-кэша для LLM на моделях Qwen 3.6 27B и Gemma 4 31B. Метод KVarN от Huawei в 6-битном режиме превзошёл стандартный q8_0 по качеству при меньшем потреблении памяти, а Precision Tail (хранение последних токенов в BF16) показал наилучшие результаты.

score 55r/LocalLLaMA