Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention
Open paper
Benchmark
Model
Rank
Results
d4rl-on-d4rl
Linear Transformer
#6
Average Reward: 64.4
language-modelling-on-wikitext-103
Linear Attention 125M
#58
Test perplexity: 25.6
Rank counts only results with a code link.