Reddit
Если у MoE маленькие эксперты, почему нельзя создать целую модель-эксперт, а не одну большую с несколькими экспертами?
Пользователь задаёт вопрос о целесообразности создания небольших специализированных моделей вместо больших MoE-архитектур. Обсуждается возможность выпуска нейросетей под конкретные задачи, например, кодинг, с меньшим количеством параметров. Тема касается эффективности и дизайна современных языковых моделей.
score 40r/LocalLLaMA