Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer

Benchmark Model Rank Results
language-modelling-on-one-billion-wordHigh-Budget MoE#15PPL: 28.0Number of params: 5B
language-modelling-on-one-billion-wordLow-Budget MoE#20PPL: 34.1Number of params: 5B
machine-translation-on-wmt2014-english-frenchMoE#30BLEU score: 40.56Hardware Burden: 142G
machine-translation-on-wmt2014-english-germanMoE#56BLEU score: 26.03Hardware Burden: 24G