Назад к дайджесту
Reddit

Оптимизация развертывания Qwen3.5-9B на 8 GPU NVIDIA T4: поиск альтернативы llama.cpp

Пользователь ищет способ снизить задержку при обслуживании 10-15 пользователей моделью Qwen3.5-9B на сервере с восемью видеокартами NVIDIA T4. Текущее решение на базе llama.cpp демонстрирует приемлемую скорость генерации, но вызывает вопросы по узким местам системы, и автор рассматривает переход на vLLM или другие оптимизированные фреймворки для ускорения инференса без дополнительных затрат на железо.

score 55r/LocalLLaMA