| abstractive-text-summarization-on-cnn-daily | T5 | #21 | ROUGE-1: 43.52ROUGE-2: 21.55ROUGE-L: 40.69 |
| answer-generation-on-weibopolls | T5 | #2 | ROUGE-1: 46.20ROUGE-L: 43.32BLEU-1: 37.77BLEU-3: 25.86 |
| common-sense-reasoning-on-record | T5-XXL 11B (fine-tuned) | #4 | EM: 93.4 |
| common-sense-reasoning-on-record | T5-11B | #14 | F1: 94.1 |
| coreference-resolution-on-winograd-schema | T5-XXL 11B (fine-tuned) | #5 | Accuracy: 93.8 |
| document-summarization-on-cnn-daily-mail | T5-11B | #9 | ROUGE-1: 43.52ROUGE-2: 21.55ROUGE-L: 40.69 |
| linguistic-acceptability-on-cola | T5-11B | #8 | Accuracy: 70.8% |
| linguistic-acceptability-on-cola | T5-XL 3B | #16 | Accuracy: 67.1% |
| linguistic-acceptability-on-cola | T5-Large 770M | #20 | Accuracy: 61.2% |
| linguistic-acceptability-on-cola | T5-Base | #29 | Accuracy: 51.1% |
| linguistic-acceptability-on-cola | T5-Small | #33 | Accuracy: 41.0% |
| machine-translation-on-wmt2014-english-french | T5 | #9 | BLEU score: 43.4 |
| machine-translation-on-wmt2014-english-german | T5-11B | #4 | BLEU score: 32.1Number of Params: 11110M |
| multimodal-intent-recognition-on-photochat | T5-3B | #2 | F1: 58.9Precision: 54.1Recall: 64.6 |
| multimodal-intent-recognition-on-photochat | T5-base | #3 | F1: 58.1Precision: 58.2Recall: 57.9 |
| natural-language-inference-on-commitmentbank | T5-XXL 11B (fine-tuned) | #5 | Accuracy: 96.8F1: 93.9 |
| natural-language-inference-on-commitmentbank | T5-Large 770M (fine-tuned) | #6 | Accuracy: 94.4F1: 90.3 |
| natural-language-inference-on-commitmentbank | T5-Base 220M (fine-tuned) | #7 | Accuracy: 94F1: 86.2 |
| natural-language-inference-on-multinli | T5-XXL 11B (fine-tuned) | #1 | Matched: 92.0 |
| natural-language-inference-on-multinli | T5-3B | #3 | Matched: 91.4Mismatched: 91.2 |
| natural-language-inference-on-multinli | T5-Large | #9 | Matched: 89.9 |
| natural-language-inference-on-multinli | T5-Base | #18 | Matched: 87.1Mismatched: 86.2 |
| natural-language-inference-on-multinli | T5-Small | #31 | Matched: 82.4Mismatched: 82.3 |
| natural-language-inference-on-multinli | T5-11B | #48 | Mismatched: 91.7 |
| natural-language-inference-on-multinli | T5-Large 770M | #50 | Mismatched: 89.6 |
| natural-language-inference-on-qnli | T5-11B | #5 | Accuracy: 96.7% |
| natural-language-inference-on-qnli | T5-3B | #6 | Accuracy: 96.3% |
| natural-language-inference-on-qnli | T5-Large 770M | #10 | Accuracy: 94.8% |
| natural-language-inference-on-qnli | T5-Base | #16 | Accuracy: 93.7% |
| natural-language-inference-on-qnli | T5-Small | #29 | Accuracy: 90.3% |
| natural-language-inference-on-rte | T5-XXL 11B (fine-tuned) | #6 | Accuracy: 92.5% |
| natural-language-inference-on-rte | T5-XL 3B | #12 | Accuracy: 91.1% |
| natural-language-inference-on-rte | T5-Large 770M | #18 | Accuracy: 87.2% |
| natural-language-inference-on-rte | T5-Base 220M | #31 | Accuracy: 80.1% |
| natural-language-inference-on-rte | T5-Small | #47 | Accuracy: 69.9% |
| natural-language-inference-on-wnli | T5-XXL 11B | #2 | Accuracy: 93.2 |
| natural-language-inference-on-wnli | T5-XL 3B | #5 | Accuracy: 89.7 |
| natural-language-inference-on-wnli | T5-Large 770M | #8 | Accuracy: 85.6 |
| natural-language-inference-on-wnli | T5-Base 220M | #10 | Accuracy: 78.8 |
| natural-language-inference-on-wnli | T5-Small 60M | #16 | Accuracy: 69.2 |
| poll-generation-on-weibopolls | T5 | #2 | ROUGE-1: 45.33ROUGE-L: 42.69BLEU-1: 37.34BLEU-3: 21.06 |
| question-answering-on-boolq | T5-XXL 11B (fine-tuned) | #4 | Accuracy: 91.2 |
| question-answering-on-boolq | T5-Large 770M (fine-tuned) | #14 | Accuracy: 85.4 |
| question-answering-on-boolq | T5-Base 220M (fine-tuned) | #24 | Accuracy: 81.4 |
| question-answering-on-boolq | T5-Small 60M (fine-tuned) | #31 | Accuracy: 76.4 |
| question-answering-on-copa | T5-XXL 11B (fine-tuned) | #7 | Accuracy: 94.8 |
| question-answering-on-copa | T5-XL 3B (fine-tuned) | #9 | Accuracy: 92 |
| question-answering-on-copa | T5-Large 770M (fine-tuned) | #31 | Accuracy: 83.4 |
| question-answering-on-copa | T5-Base 220M (fine-tuned) | #41 | Accuracy: 71.2 |
| question-answering-on-multirc | T5-XXL 11B (fine-tuned) | #5 | F1: 88.1 |
| question-answering-on-multirc | T5-11B | #24 | EM: 63.3 |
| question-answering-on-quora-question-pairs | T5-11B | #4 | Accuracy: 90.4% |
| question-answering-on-quora-question-pairs | T5-Large 770M | #8 | Accuracy: 89.9% |
| question-answering-on-quora-question-pairs | T5-3B | #10 | Accuracy: 89.7% |
| question-answering-on-quora-question-pairs | T5-Base | #11 | Accuracy: 89.4% |
| question-answering-on-quora-question-pairs | T5-Small | #15 | Accuracy: 88.0% |
| question-answering-on-squad11-dev | T5-11B | #1 | EM: 90.06F1: 95.64 |
| question-answering-on-squad11-dev | T5-3B | #5 | EM: 88.53F1: 94.95 |
| question-answering-on-squad11-dev | T5-Large 770M | #6 | EM: 86.66F1: 93.79 |
| question-answering-on-squad11-dev | T5-Base | #8 | EM: 85.44F1: 92.08 |
| question-answering-on-squad11-dev | T5-Small | #16 | EM: 79.1F1: 87.24 |
| question-answering-on-webquestions | T5.1.1-XXL+SSM | #11 | EM: 42.8 |
| question-generation-on-weibopolls | T5 | #2 | ROUGE-1: 44.46ROUGE-L: 42.06BLEU-1: 36.91BLEU-3: 16.26 |
| semantic-parsing-on-webquestionssp | T5-11B (Raffel et al., 2020) | #3 | Accuracy: 56.5 |
| semantic-textual-similarity-on-mrpc | T5-11B | #11 | Accuracy: 90.0%F1: 91.9 |
| semantic-textual-similarity-on-mrpc | T5-Large | #12 | Accuracy: 89.9%F1: 92.4 |
| semantic-textual-similarity-on-mrpc | T5-3B | #14 | Accuracy: 89.2%F1: 92.5 |
| semantic-textual-similarity-on-mrpc | T5-Base | #19 | Accuracy: 87.5%F1: 90.7 |
| semantic-textual-similarity-on-mrpc | T5-Small | #26 | Accuracy: 86.6%F1: 89.7 |
| semantic-textual-similarity-on-sts-benchmark | T5-11B | #4 | Pearson Correlation: 0.925Spearman Correlation: 0.921 |
| semantic-textual-similarity-on-sts-benchmark | T5-3B | #12 | Pearson Correlation: 0.906Spearman Correlation: 0.898 |
| semantic-textual-similarity-on-sts-benchmark | T5-Large | #15 | Pearson Correlation: 0.899 |
| semantic-textual-similarity-on-sts-benchmark | T5-Base | #16 | Pearson Correlation: 0.894 |
| semantic-textual-similarity-on-sts-benchmark | T5-Small | #19 | Pearson Correlation: 0.856Spearman Correlation: 0.85 |
| semantic-textual-similarity-on-sts-benchmark | T5-Large 770M | #29 | Spearman Correlation: 0.886 |
| sentiment-analysis-on-sst-2-binary | T5-11B | #1 | Accuracy: 97.5 |
| sentiment-analysis-on-sst-2-binary | T5-3B | #3 | Accuracy: 97.4 |
| sentiment-analysis-on-sst-2-binary | T5-Large 770M | #16 | Accuracy: 96.3 |
| sentiment-analysis-on-sst-2-binary | T5-Base | #23 | Accuracy: 95.2 |
| sentiment-analysis-on-sst-2-binary | T5-Small | #44 | Accuracy: 91.8 |
| word-sense-disambiguation-on-words-in-context | T5-XXL 11B | #6 | Accuracy: 76.9 |