| common-sense-reasoning-on-record | BERT-Base (single model) | #12 | EM: 54.040F1: 56.065 |
| coreference-resolution-on-winograd-schema | BERT-large 340M | #44 | Accuracy: 62.0 |
| emotion-recognition-in-conversation-on-cped | BERT_{utt} | #5 | Accuracy of Sentiment: 48.96Macro-F1 of Sentiment: 45.18 |
| linguistic-acceptability-on-cola | BERT-LARGE | #21 | Accuracy: 60.5% |
| multimodal-intent-recognition-on-photochat | BERT | #4 | F1: 53.2Precision: 56.1Recall: 50.6 |
| natural-language-inference-on-multinli | BERT-LARGE | #19 | Matched: 86.7Mismatched: 85.9 |
| natural-language-inference-on-qnli | BERT-LARGE | #20 | Accuracy: 92.7% |
| natural-language-inference-on-rte | BERT-large 340M | #46 | Accuracy: 70.1% |
| natural-language-inference-on-wnli | BERT-large 340M | #18 | Accuracy: 65.1 |
| natural-language-understanding-on-pdp60 | BERT-large 340M | #2 | Accuracy: 78.3 |
| paraphrase-identification-on-quora-question | BERT-LARGE | #11 | F1: 72.1 |
| question-answering-on-coqa | BERT Large Augmented (single model) | #1 | In-domain: 82.5Out-of-domain: 77.6Overall: 81.1 |
| question-answering-on-coqa | BERT-base finetune (single model) | #2 | In-domain: 79.8Out-of-domain: 74.1Overall: 78.1 |
| question-answering-on-multirc | BERT-large(single model) | #14 | F1: 70.0EM: 24.1 |
| question-answering-on-multitq | BERT | #7 | Hits@1: 8.3Hits@10: 48.2 |
| question-answering-on-piqa | BERT-Large 340M | #59 | Accuracy: 66.7 |
| question-answering-on-squad11 | BERT (ensemble) | #6 | EM: 87.433F1: 93.160 |
| question-answering-on-squad11 | BERT-LARGE (Ensemble+TriviaQA) | #7 | EM: 87.4F1: 93.2 |
| question-answering-on-squad11 | BERT (single model) | #8 | EM: 85.083F1: 91.835 |
| question-answering-on-squad11 | BERT-LARGE (Single+TriviaQA) | #49 | F1: 91.8 |
| question-answering-on-squad11-dev | BERT-LARGE (Ensemble+TriviaQA) | #7 | EM: 86.2F1: 92.2 |
| question-answering-on-squad11-dev | BERT-LARGE (Single+TriviaQA) | #9 | EM: 84.2F1: 91.1 |
| semantic-textual-similarity-on-mrpc | BERT-LARGE | #33 | F1: 89.3 |
| semantic-textual-similarity-on-sts-benchmark | BERT-LARGE | #37 | Spearman Correlation: 0.865 |
| sentiment-analysis-on-sst-2-binary | BERT-LARGE | #26 | Accuracy: 94.9 |
| stock-market-prediction-on-astock | Bert Chinese | #15 | Accuray: 59.11F1-score: 58.99Recall: 59.20Precision: 59.07 |
| text-classification-on-dbpedia | Bidirectional Encoder Representations from Transformers | #2 | Error: 0.64 |
| type-prediction-on-manytypes4typescript | BERT | #6 | Average Accuracy: 57.52Average Precision: 54.18Average Recall: 54.02… |