Adaptive Attention Span in Transformers

Benchmark Model Rank Results
language-modelling-on-enwiki8Transformer (24 layers, 8k adaptive span)#10Bit per Character (BPC): 0.98Number of params: 209M
language-modelling-on-enwiki8Transformer (12 layers, 8k adaptive span)#19Bit per Character (BPC): 1.02Number of params: 39M
language-modelling-on-text824L Transformer + 8K adaptive span#3Bit per Character (BPC): 1.07Number of params: 209M
language-modelling-on-text812L Transformer + 8K adaptive span#7Bit per Character (BPC): 1.11Number of params: 38M