Назад к дайджесту
Reddit

Бенчмарк модели DeepSeek-V4-Flash с квантованием Q3_K_XL на трёх RTX 3090

Пользователь опубликовал результаты тестирования 284-миллиардной модели DeepSeek-V4-Flash в квантовании Q3_K_XL на конфигурации из трёх видеокарт RTX 3090. Сравнение режимов показывает компромисс между скоростью префикса и генерации при выгрузке MoE-слоёв на CPU. Результаты важны для энтузиастов, планирующих запуск больших моделей на локальном оборудовании.

score 40r/LocalLLaMA