Reddit
Оптимизация Extended Garlic: запуск Qwen3.5 35B на RTX 5060 Ti со скоростью 55 ток/с
Автор достиг скорости генерации 55 токенов в секунду на видеокарте RTX 5060 Ti, запустив модель Qwen3.5 35B A3B float8 с использованием Gated Delta Network kernels. Это решение значительно превосходит результаты llama.cpp с квантованием Q8, а поддержка MTP может ускорить процесс ещё сильнее. Детали оптимизации планируется опубликовать в отдельном блоге.
score 40r/LocalLLaMA