Muppet: Massive Multi-task Representations with Pre-Finetuning

Benchmark Model Rank Results
abstractive-text-summarization-on-cnn-dailyMUPPET BART Large#11ROUGE-1: 44.45ROUGE-2: 21.25ROUGE-L: 41.4
common-sense-reasoning-on-commonsenseqaMUPPET Roberta Large#7Accuracy: 79.2
natural-language-inference-on-rteMUPPET Roberta Large#4Accuracy: 92.8%
question-answering-on-boolqMUPPET Roberta Large#11Accuracy: 87.5
question-answering-on-boolqMUPPET Roberta Base#18Accuracy: 83.8
sentence-completion-on-hellaswagMUPPET Roberta Large#16Accuracy: 86.4
sentiment-analysis-on-sst-2-binaryMUPPET Roberta Large#4Accuracy: 97.4
sentiment-analysis-on-sst-2-binaryMUPPET Roberta base#12Accuracy: 96.7
text-summarization-on-gigawordMUPPET BART Large#2ROUGE-1: 40.4ROUGE-2: 20.54ROUGE-L: 36.21
text-summarization-on-reddit-tifuMUPPET BART Large#2ROUGE-1: 30.3ROUGE-2: 11.25ROUGE-L: 24.92