Назад к дайджесту
Reddit

Бенчмарк модели DeepSeek V4 Flash 0731 IQ2_M на двух RTX 3060 с выгрузкой в RAM

Автор поделился результатами запуска LLM DeepSeek V4 Flash 0731 IQ2_M на домашнем ПК с двумя видеокартами RTX 3060 и 96 ГБ оперативной памяти. Для обхода ограничений LM Studio использовался Unsloth Studio, что обеспечило работу модели с выгрузкой части весов в RAM. Скорость генерации составила от 3.5 до 4.5 токенов в секунду при общем энергопотреблении системы около 130 Вт.

score 40r/LocalLLaMA