Reddit
ParaRNN: Параллельное обучение нелинейных RNN (sLSTM, RWKV-7, CfC, Titans) с помощью Triton Newton-сканов [P]
Представлена открытая библиотека ParaRNN на PyTorch/Triton, которая ускоряет обучение нелинейных рекуррентных архитектур за счет параллелизации по времени с использованием итераций Ньютона-Рафсона и ассоциативных префиксных сканов. Достигается ускорение до ~200 раз по сравнению с последовательным BPTT на длинных последовательностях (например, CfC при T=2048: 2.79 мс против 643 мс на RTX 3060), а также сохраняется плоская сходимость до 131k токенов. Поддерживаются ядра для sLSTM, RWKV-7, CfC, Titans, Modern Hopfield и M²RNN, интеграция с torch.compile и плагин для vLLM.
score 40r/MachineLearning