BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Benchmark Model Rank Results
common-sense-reasoning-on-recordBERT-Base (single model)#12EM: 54.040F1: 56.065
coreference-resolution-on-winograd-schemaBERT-large 340M#44Accuracy: 62.0
emotion-recognition-in-conversation-on-cpedBERT_{utt}#5Accuracy of Sentiment: 48.96Macro-F1 of Sentiment: 45.18
linguistic-acceptability-on-colaBERT-LARGE#21Accuracy: 60.5%
multimodal-intent-recognition-on-photochatBERT#4F1: 53.2Precision: 56.1Recall: 50.6
natural-language-inference-on-multinliBERT-LARGE#19Matched: 86.7Mismatched: 85.9
natural-language-inference-on-qnliBERT-LARGE#20Accuracy: 92.7%
natural-language-inference-on-rteBERT-large 340M#46Accuracy: 70.1%
natural-language-inference-on-wnliBERT-large 340M#18Accuracy: 65.1
natural-language-understanding-on-pdp60BERT-large 340M#2Accuracy: 78.3
paraphrase-identification-on-quora-questionBERT-LARGE#11F1: 72.1
question-answering-on-coqaBERT Large Augmented (single model)#1In-domain: 82.5Out-of-domain: 77.6Overall: 81.1
question-answering-on-coqaBERT-base finetune (single model)#2In-domain: 79.8Out-of-domain: 74.1Overall: 78.1
question-answering-on-multircBERT-large(single model)#14F1: 70.0EM: 24.1
question-answering-on-multitqBERT#7Hits@1: 8.3Hits@10: 48.2
question-answering-on-piqaBERT-Large 340M#59Accuracy: 66.7
question-answering-on-squad11BERT (ensemble)#6EM: 87.433F1: 93.160
question-answering-on-squad11BERT-LARGE (Ensemble+TriviaQA)#7EM: 87.4F1: 93.2
question-answering-on-squad11BERT (single model)#8EM: 85.083F1: 91.835
question-answering-on-squad11BERT-LARGE (Single+TriviaQA)#49F1: 91.8
question-answering-on-squad11-devBERT-LARGE (Ensemble+TriviaQA)#7EM: 86.2F1: 92.2
question-answering-on-squad11-devBERT-LARGE (Single+TriviaQA)#9EM: 84.2F1: 91.1
semantic-textual-similarity-on-mrpcBERT-LARGE#33F1: 89.3
semantic-textual-similarity-on-sts-benchmarkBERT-LARGE#37Spearman Correlation: 0.865
sentiment-analysis-on-sst-2-binaryBERT-LARGE#26Accuracy: 94.9
stock-market-prediction-on-astockBert Chinese#15Accuray: 59.11F1-score: 58.99Recall: 59.20Precision: 59.07
text-classification-on-dbpediaBidirectional Encoder Representations from Transformers#2Error: 0.64
type-prediction-on-manytypes4typescriptBERT#6Average Accuracy: 57.52Average Precision: 54.18Average Recall: 54.02