Reddit
NInfer против llama.cpp и vLLM: сравнение качества и скорости для Qwen3.8-27B NVFP4 на RTX 5090
Пользователь провел детальное сравнение трех движков инференса (llama.cpp, vLLM, NInfer) для локального запуска Qwen3.8-27B на одной RTX 5090. Тесты включали классификацию релевантности, поиск иголок в длинном контексте, QA по нескольким транскриптам, рассуждения, структурированное извлечение и воспроизведение инструментов. Результаты показывают различия в качестве, скорости и поддержке функций (например, NInfer не поддерживает json_mode).
score 55r/LocalLLaMA