Reddit
Оптимизация развертывания Qwen3.5-9B на 8 GPU NVIDIA T4: поиск альтернативы llama.cpp
Пользователь ищет способ снизить задержку при обслуживании 10-15 пользователей моделью Qwen3.5-9B на сервере с восемью видеокартами NVIDIA T4. Текущее решение на базе llama.cpp демонстрирует приемлемую скорость генерации, но вызывает вопросы по узким местам системы, и автор рассматривает переход на vLLM или другие оптимизированные фреймворки для ускорения инференса без дополнительных затрат на железо.
score 55r/LocalLLaMA