Назад к дайджесту
Reddit

Оптимизация вычислительного графа Qwen для Vulkan в llama.cpp

В репозиторий llama.cpp предложен пулл-реквест, объединяющий цепочку операций SCALE -> SIGMOID -> SCALE -> hc_post в единый ядро для ускорения работы моделей Qwen на GPU с поддержкой Vulkan. Это изменение направлено на снижение накладных расходов и повышение производительности инференса для пользователей, использующих Vulkan-бэкенд.

score 55r/LocalLLaMA