Reddit
Обучение модели MoE на 3.87B параметров с нуля на 86.5B токенов
Автор представил архитектуру Decoder-only MoE (Apex-2) с 1.45B активных параметров, обученную с нуля на 86.5B токенов предобучения. Модель демонстрирует конкурентоспособные результаты в коде (HumanEval+), но уступает в знаниях и математике из-за малого объема данных, а применение DPO оказалось неэффективным.
score 40r/LocalLLaMA