SpanBERT: Improving Pre-training by Representing and Predicting Spans

Benchmark Model Rank Results
coreference-resolution-on-ontonotesSpanBERT#10F1: 79.6
linguistic-acceptability-on-colaSpanBERT#18Accuracy: 64.3%
natural-language-inference-on-multinliSpanBERT#12Matched: 88.1
natural-language-inference-on-qnliSpanBERT#15Accuracy: 94.3%
natural-language-inference-on-rteSpanBERT#34Accuracy: 79.0%
open-domain-question-answering-on-searchqaSpanBERT#10F1: 84.8
paraphrase-identification-on-quora-questionSpanBERT#12F1: 71.9Accuracy: 89.5
question-answering-on-naturalqaSpanBERT#3F1: 82.5
question-answering-on-newsqaSpanBERT#12F1: 73.6
question-answering-on-squad11SpanBERT (single model)#4EM: 88.8F1: 94.6Hardware Burden: 586G
question-answering-on-squad20SpanBERT#16EM: 85.7F1: 88.7
question-answering-on-squad20-devSpanBERT#6F1: 86.8
question-answering-on-triviaqaSpanBERT#29F1: 83.6
relation-classification-on-tacred-1SpanBERT#7F1: 70.8
relation-extraction-on-re-tacredSpanBERT#4F1: 85.3
relation-extraction-on-tacredSpanBERT-large#17F1: 70.8
semantic-textual-similarity-on-mrpcSpanBERT#7Accuracy: 90.9%
semantic-textual-similarity-on-sts-benchmarkSpanBERT#14Pearson Correlation: 0.899
sentiment-analysis-on-sst-2-binarySpanBERT#28Accuracy: 94.8