PIQA: Reasoning about Physical Commonsense in Natural Language

Benchmark Model Rank Results
question-answering-on-piqaRoBERTa-large 355M (fine-tuned)#40Accuracy: 77.1
question-answering-on-piqaGPT-2-small 124M (fine-tuned)#56Accuracy: 69.2
question-answering-on-piqaBERT-large 340M (fine-tuned)#58Accuracy: 66.8
question-answering-on-piqaRandom chance baseline#62Accuracy: 50