Назад к дайджесту
Reddit

Engram безумствует! Обновление 2b-модели...

Автор делится обновлением своей модели на 2.6B параметров с таблицей Engram размером 4.3B. Модель использует Attention Based Residuals, замороженные embedding/LM head, сжатые через SVD из OLMo 3, и состоит из 41 слоя с SWA и глобальным вниманием. Обсуждается оптимизация вычислений и архитектурные детали.

score 40r/LocalLLaMA