Single Headed Attention RNN: Stop Thinking With Your Head

Benchmark Model Rank Results
language-modelling-on-enwiki8SHA-RNN (4 layers, h=1024, attention head per layer)#26Bit per Character (BPC): 1.068Number of params: 54M
language-modelling-on-enwiki8SHA-RNN (4 layers, h=1024, single attention head)#27Bit per Character (BPC): 1.076Number of params: 52M
language-modelling-on-enwiki8SHA-LSTM (4 layers, h=1024, no attention head)#37Bit per Character (BPC): 1.33Number of params: 51M