Назад к дайджесту
Reddit

WarpState: эксперименты с двухмасштабной ассоциативной памятью и локальным вниманием для длительно работающих LLM

WarpState — экспериментальная архитектура LLM, которая вместо растущей истории KV-состояний поддерживает компактную рекуррентную память. Внутри небольших неперекрывающихся чанков токенов используется точное причинное self-attention, а на каждую голову внимания приходится две ассоциативные матричные памяти — быстрая и медленная — с раздельно обучаемыми коэффициентами затухания. Входной гейт динамически балансирует между локальным вниманием и рекуррентной памятью; референсная модель имеет около 2 млрд параметров.

score 40r/OpenAI