Назад к дайджесту
Reddit

Оптимизация спекулятивного декодирования в llama.cpp: новые ядра для Metal и ускорение генерации

Разработчик представил pull-реквест в проект llama.cpp, добавляющий оптимизированные ядра для вычисления матричных умножений и копирования данных на GPU Apple (Metal). Изменения направлены на ускорение спекулятивного декодирования, что позволяет значительно увеличить скорость генерации токенов при использовании моделей-драфтеров, таких как DFlash2.

score 55r/LocalLLaMA