Назад к дайджесту
Reddit

Запуск Qwen 2.5 27B на AMD NPU через FastFlowLM с высокой скоростью декодирования

Пользователи получили возможность запускать модель Qwen 2.5 объемом 27 миллиардов параметров на аппаратных ускорителях AMD NPU с использованием фреймворка FastFlowLM. Отмечается высокая производительность декодирования, достигающая 1 токена в секунду, что делает решение эффективным для локального развертывания.

score 40r/LocalLLaMA