Reddit
Трансформеры против RNN и SSM: где на самом деле живет память модели?
Автор анализирует компромиссы в хранении контекста между архитектурой RNN, Transformers и SSM (например, Mamba). Рассматривается, как каждая из моделей управляет рабочей памятью: через компактное рекуррентное состояние, растущий KV-кэш или вход-зависимые правила обновления состояния.
score 40r/MachineLearning