Reddit
Ускорение декодирования на 10% с квантованием Q4_K для Gemma 4 31b
Пользователь поделился опытом квантования MTP draft модели Gemma 4 31b в формат Q4_K вместо стандартного Q4_0, что дало прирост скорости декодирования с 65 до 72 токенов в секунду на конфигурации с двумя RTX 3090. Эксперимент проводился с GGUF-версией модели, при этом квантование в Q2_K показало худшие результаты.
score 40r/LocalLLaMA