Reddit
Оптимизация умножения матриц для k-квантования в ggml-cpu
Разработчик jbooth предложил пулл-реквест в проект llama.cpp, внедряющий оптимизированное умножение матриц (mul_mat) для k-квантованных моделей. Новая реализация использует инструкцию VNNI для ускорения обработки промптов на CPU, что обещает увеличение скорости в 3-7 раз при минимальном усложнении кода.
score 55r/LocalLLaMA