| linguistic-acceptability-on-cola | XLNet (single model) | #10 | Accuracy: 69% |
| natural-language-inference-on-anli-test | XLNet (Large) | #5 | A1: 70.3A2: 50.9A3: 49.4 |
| natural-language-inference-on-multinli | XLNet (single model) | #6 | Matched: 90.8 |
| natural-language-inference-on-qnli | XLNet (single model) | #9 | Accuracy: 94.9% |
| natural-language-inference-on-rte | XLNet (single model) | #21 | Accuracy: 85.9% |
| natural-language-inference-on-wnli | XLNet | #3 | Accuracy: 92.5 |
| paraphrase-identification-on-quora-question | XLNet-Large (ensemble) | #6 | F1: 74.2Accuracy: 90.3 |
| question-answering-on-quora-question-pairs | XLNet (single model) | #1 | Accuracy: 92.3% |
| question-answering-on-race | XLNet | #1 | RACE-m: 85.45RACE: 81.75 |
| question-answering-on-squad11 | XLNet (single model) | #3 | EM: 89.898F1: 95.080Hardware Burden: 46449G |
| question-answering-on-squad11-dev | XLNet (single model) | #4 | EM: 89.7F1: 95.1 |
| question-answering-on-squad20 | XLNet (single model) | #9 | EM: 87.926F1: 90.689 |
| question-answering-on-squad20-dev | XLNet (single model) | #1 | F1: 90.6EM: 87.9 |
| reading-comprehension-on-race | XLNet | #7 | Accuracy (Middle): 88.6Accuracy (High): 84.0 |
| semantic-textual-similarity-on-mrpc | XLNet (single model) | #8 | Accuracy: 90.8% |
| semantic-textual-similarity-on-sts-benchmark | XLNet (single model) | #2 | Pearson Correlation: 0.925 |
| sentiment-analysis-on-imdb | XLNet | #3 | Accuracy: 96.21 |
| sentiment-analysis-on-sst-2-binary | XLNet (single model) | #6 | Accuracy: 97 |
| sentiment-analysis-on-sst-2-binary | XLNet-Large (ensemble) | #9 | Accuracy: 96.8 |
| sentiment-analysis-on-yelp-binary | XLNet | #1 | Error: 1.37 |
| sentiment-analysis-on-yelp-fine-grained | XLNet | #1 | Error: 27.05 |
| text-classification-on-ag-news | XLNet | #1 | Error: 4.45 |
| text-classification-on-dbpedia | XLNet | #1 | Error: 0.62 |
| text-classification-on-yelp-2 | XLNet | #1 | Accuracy: 98.63% |
| text-classification-on-yelp-5 | XLNet | #2 | Accuracy: 72.95% |