Finetuning Pretrained Transformers into RNNs

Benchmark Model Rank Results
language-modelling-on-wikitext-103T2R + Pretrain#41Test perplexity: 19.6Validation perplexity: 19
machine-translation-on-wmt2014-english-frenchT2R + Pretrain#19BLEU score: 42.1
machine-translation-on-wmt2014-english-germanT2R + Pretrain#34BLEU score: 28.7
machine-translation-on-wmt2017-chineseT2R + Pretrain#2BLEU: 23.8