Назад к дайджесту
Новость

Запоминание против обобщения: что реально умеет TLM на 2160 параметров

Статья посвящена эксперименту с крошечной языковой моделью (TLM) на 2160 параметров, исследующему баланс между запоминанием и обобщением. Автор приводит конкретные метрики: 99,93% для знакомых шаблонов и 81,69% для перестановок токенов. Материал полезен для понимания фундаментальных ограничений минималистичных нейросетей.