Reddit
WarpState: эксперименты с двухмасштабной ассоциативной памятью и локальным вниманием для длительно работающих LLM
WarpState — экспериментальная архитектура LLM, которая вместо растущей истории KV-состояний поддерживает компактную рекуррентную память. Внутри небольших неперекрывающихся чанков токенов используется точное причинное self-attention, а на каждую голову внимания приходится две ассоциативные матричные памяти — быстрая и медленная — с раздельно обучаемыми коэффициентами затухания. Входной гейт динамически балансирует между локальным вниманием и рекуррентной памятью; референсная модель имеет около 2 млрд параметров.
score 40r/OpenAI