Назад к дайджесту
Reddit

DeepSeek V4 Flash 0731: Тест производительности квантования Q3_K_XL Unsloth

Пользователь делится результатами локального запуска модели DeepSeek V4 Flash 0731 через llama-server на гибридной конфигурации GPU (RTX 6000 + W7800). Отмечается высокая скорость генерации (27.2 токена/сек) и сравнение эффективности с моделями K3 и GLM 5.2.

score 40r/LocalLLaMA