Назад к дайджесту
Reddit

Оптимизация Extended Garlic: запуск Qwen3.5 35B на RTX 5060 Ti со скоростью 55 ток/с

Автор достиг скорости генерации 55 токенов в секунду на видеокарте RTX 5060 Ti, запустив модель Qwen3.5 35B A3B float8 с использованием Gated Delta Network kernels. Это решение значительно превосходит результаты llama.cpp с квантованием Q8, а поддержка MTP может ускорить процесс ещё сильнее. Детали оптимизации планируется опубликовать в отдельном блоге.

score 40r/LocalLLaMA