Назад к дайджесту
Reddit

Если у MoE маленькие эксперты, почему нельзя создать целую модель-эксперт, а не одну большую с несколькими экспертами?

Пользователь задаёт вопрос о целесообразности создания небольших специализированных моделей вместо больших MoE-архитектур. Обсуждается возможность выпуска нейросетей под конкретные задачи, например, кодинг, с меньшим количеством параметров. Тема касается эффективности и дизайна современных языковых моделей.

score 40r/LocalLLaMA