Reddit
Оптимизация вычислительного графа Qwen для Vulkan в llama.cpp
В репозиторий llama.cpp предложен пулл-реквест, объединяющий цепочку операций SCALE -> SIGMOID -> SCALE -> hc_post в единый ядро для ускорения работы моделей Qwen на GPU с поддержкой Vulkan. Это изменение направлено на снижение накладных расходов и повышение производительности инференса для пользователей, использующих Vulkan-бэкенд.
score 55r/LocalLLaMA