Character-Level Language Modeling with Deeper Self-Attention

Benchmark Model Rank Results
language-modelling-on-enwiki8Transformer (64 layers)#24Bit per Character (BPC): 1.06Number of params: 235M
language-modelling-on-enwiki864-layer Character Transformer Model#28Bit per Character (BPC): 1.11Number of params: 44M
language-modelling-on-hutter-prize64-layer Character Transformer Model#8Bit per Character (BPC): 1.06Number of params: 235M
language-modelling-on-hutter-prize12-layer Character Transformer Model#11Bit per Character (BPC): 1.11Number of params: 44M
language-modelling-on-text864-layer Character Transformer Model#10Bit per Character (BPC): 1.13Number of params: 235M
language-modelling-on-text812-layer Character Transformer Model#12Bit per Character (BPC): 1.18Number of params: 44M