Назад к дайджесту
Reddit

DeepSeek-V4-Flash-0731 UD-IQ3_S: 12.5 ток/с на RTX 3090 с 128 ГБ DDR5

Пользователь успешно запустил квантованную версию модели DeepSeek-V4-Flash-0731 UD-IQ3_S в text-generation-webui с использованием llama.cpp. Для работы на видеокарте RTX 3090 с 24 ГБ памяти применён обходной путь с выгрузкой MoE-экспертов в системную RAM через флаг --n-cpu-moe. Итоговая скорость генерации составила 12.5 токенов в секунду при использовании 128 ГБ оперативной памяти.

score 40r/LocalLLaMA