Назад к дайджесту
Reddit

Qwen3.8-27B на двух RTX 5070 Ti 16GB — сравнение llama.cpp, vLLM и NInfer

Пользователь протестировал три движка инференса (llama.cpp, vLLM и NInfer) для запуска модели Qwen3.8-27B на двух видеокартах RTX 5070 Ti 16GB. Все движки показали скорость декодирования около 100-115 ток/с с использованием спекулятивного декодирования MTP3, при этом основным отличием стали размер контекста и сложность настройки. Также представлены результаты бенчмарков для llama.cpp на одной и двух GPU, включая скорость обработки промпта и декодирования.

score 55r/LocalLLaMA