Reddit
NInfer6000: оптимизация Qwen 3.8 Flash Next для RTX 6000 с производительностью до 400 токенов в секунду
Разработчик представил форк NInfer, адаптированный для видеокарт NVIDIA RTX 6000 с 96 ГБ памяти, демонстрирующий рекордную скорость генерации до 400 токенов в секунду на модели Qwen 3.8 Flash Next. Решение использует квантование NVFP4, технику MTP3 и снижение разрядности для достижения высокой производительности при сохранении поддержки визуальных данных.
score 40r/LocalLLaMA