Augmenting Self-attention with Persistent Memory

Benchmark Model Rank Results
language-modelling-on-enwiki8All-attention network (18 layers)#18Bit per Character (BPC): 1.01Number of params: 39M
language-modelling-on-enwiki8All-attention network (36 layers)#40Number of params: 114M
language-modelling-on-text8All-attention network - 36 layers#5Bit per Character (BPC): 1.08Number of params: 114M
language-modelling-on-text8All-attention network - 18 layers#8Bit per Character (BPC): 1.11Number of params: 38M
language-modelling-on-wikitext-103All-attention network (36 layers)#43Test perplexity: 20.6Validation perplexity: 19.7