Назад к дайджесту
Reddit

Экстремальное квантование DeepSeek-V4-Flash: модель сжата до 54GB при 20.5 токенах/сек

Энтузиаст применил агрессивное 2-битное квантование (IQ2_XXS) к модели DeepSeek-V4-Flash, сократив размер с 95GB до 54GB. Модель сохранила способность к связной генерации при скорости ~20.5 токенов в секунду, что делает её более доступной для локального запуска.

score 40r/LocalLLaMA