Reddit
DeepSeek V4 Flash 0731: Тест производительности квантования Q3_K_XL Unsloth
Пользователь делится результатами локального запуска модели DeepSeek V4 Flash 0731 через llama-server на гибридной конфигурации GPU (RTX 6000 + W7800). Отмечается высокая скорость генерации (27.2 токена/сек) и сравнение эффективности с моделями K3 и GLM 5.2.
score 40r/LocalLLaMA