BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions

Benchmark Model Rank Results
question-answering-on-boolqBERT-MultiNLI 340M (fine-tuned)#25Accuracy: 80.4
question-answering-on-boolqBiDAF-MultiNLI (fine-tuned)#33Accuracy: 75.57
question-answering-on-boolqGPT-1 117M (fine-tuned)#37Accuracy: 72.87
question-answering-on-boolqBiDAF + ELMo (fine-tuned)#39Accuracy: 71.41
question-answering-on-boolqMajority baseline#49Accuracy: 62.17