Назад к дайджесту
Reddit

Оптимизация умножения матриц для k-квантования в ggml-cpu

Разработчик jbooth предложил пулл-реквест в проект llama.cpp, внедряющий оптимизированное умножение матриц (mul_mat) для k-квантованных моделей. Новая реализация использует инструкцию VNNI для ускорения обработки промптов на CPU, что обещает увеличение скорости в 3-7 раз при минимальном усложнении кода.

score 55r/LocalLLaMA