Reddit
Наконец-то запустил Qwen 3.8 Next на своей установке с 6 GPU V100 (TP2 PP3)
Пользователь делится опытом запуска Qwen 3.8 Next на шести GPU V100 с использованием движка 1cat-vllm и конфигурации TP2 PP3. После решения проблем с PCIe и OOM удалось добиться стабильной работы. Спекулятивное декодирование (MTP) почти удваивает скорость генерации текста, а также приводятся результаты термальных тестов.
score 40r/LocalLLaMA