Reddit
DeepSeek: как модель на 300 млрд параметров обходится дешевле, чем модель на 9 млрд?
Пользователь Reddit спрашивает у DeepSeek, как им удаётся сделать модель с 300 миллиардами параметров дешевле в использовании или обучении, чем модель с 9 миллиардами. Обсуждение затрагивает вопросы эффективности архитектуры, оптимизации затрат и парадоксов масштабирования в LLM.
score 40r/singularity