Reddit
4x RTX 3090 PCIe 4.0 x16 — нужен совет? Qwen 3.8 Next Flash?
Пользователь апгрейдит сервер с двух RTX 3090 до четырёх и спрашивает, что делать дальше: оставить текущую модель Qwen 3.8 27b Q8 с vLLM или попробовать Qwen 3.8 Next Flash в квантовании Q4/Q5, которая должна поместиться в VRAM. Он также рассматривает возможность запуска нескольких меньших моделей параллельно и ищет другие варианты.
score 40r/LocalLLaMA