Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context

Benchmark Model Rank Results
language-modelling-on-enwiki8Transformer-XL (24 layers)#11Bit per Character (BPC): 0.99Number of params: 277M
language-modelling-on-enwiki8Transformer-XL (18 layers)#22Bit per Character (BPC): 1.03Number of params: 88M
language-modelling-on-enwiki8Transformer-XL (12 layers)#25Bit per Character (BPC): 1.06Number of params: 41M
language-modelling-on-hutter-prize24-layer Transformer-XL#4Bit per Character (BPC): 0.99Number of params: 277M
language-modelling-on-hutter-prize18-layer Transformer-XL#7Bit per Character (BPC): 1.03Number of params: 88M
language-modelling-on-hutter-prize12-layer Transformer-XL#9Bit per Character (BPC): 1.06Number of params: 41M
language-modelling-on-one-billion-wordTransformer-XL Large#4PPL: 21.8Number of params: 0.8B
language-modelling-on-one-billion-wordTransformer-XL Base#8PPL: 23.5Number of params: 0.46B
language-modelling-on-penn-treebank-wordTransformer-XL#21Test perplexity: 54.55Validation perplexity: 56.72Params: 24M
language-modelling-on-text8Transformer-XL - 24 layers#4Bit per Character (BPC): 1.08Number of params: 277M
language-modelling-on-wikitext-103Transformer-XL Large#33Test perplexity: 18.3Validation perplexity: 18.2
language-modelling-on-wikitext-103Transformer-XL Standard#52Test perplexity: 24.0Validation perplexity: 23.1