Назад к дайджесту
Reddit

Обучение модели MoE на 3.87B параметров с нуля на 86.5B токенов

Автор представил архитектуру Decoder-only MoE (Apex-2) с 1.45B активных параметров, обученную с нуля на 86.5B токенов предобучения. Модель демонстрирует конкурентоспособные результаты в коде (HumanEval+), но уступает в знаниях и математике из-за малого объема данных, а применение DPO оказалось неэффективным.

score 40r/LocalLLaMA