Reddit
Экстремальное квантование DeepSeek-V4-Flash: модель сжата до 54GB при 20.5 токенах/сек
Энтузиаст применил агрессивное 2-битное квантование (IQ2_XXS) к модели DeepSeek-V4-Flash, сократив размер с 95GB до 54GB. Модель сохранила способность к связной генерации при скорости ~20.5 токенов в секунду, что делает её более доступной для локального запуска.
score 40r/LocalLLaMA