Назад к дайджесту
Reddit

DeepSeek: как модель на 300 млрд параметров обходится дешевле, чем модель на 9 млрд?

Пользователь Reddit спрашивает у DeepSeek, как им удаётся сделать модель с 300 миллиардами параметров дешевле в использовании или обучении, чем модель с 9 миллиардами. Обсуждение затрагивает вопросы эффективности архитектуры, оптимизации затрат и парадоксов масштабирования в LLM.

score 40r/singularity