Ask Me Anything: A simple strategy for prompting language models

Benchmark Model Rank Results
coreference-resolution-on-winograd-schemaNeo-6B (QA + WS)#21Accuracy: 77.9
coreference-resolution-on-winograd-schemaNeo-6B (QA)#23Accuracy: 74.7
coreference-resolution-on-winograd-schemaNeo-6B (few-shot)#62Accuracy: 36.5
natural-language-inference-on-rteNeo-6B (QA + WS)#37Accuracy: 75.1%
natural-language-inference-on-rteNeo-6B (QA)#61Accuracy: 61.7%
natural-language-inference-on-rteNeo-6B (few-shot)#66Accuracy: 58.8%
question-answering-on-boolqNeo-6B (QA + WS)#42Accuracy: 67.2
question-answering-on-boolqNeo-6B (few-shot)#44Accuracy: 66.5
question-answering-on-boolqNeo-6B (QA)#46Accuracy: 64.9
question-answering-on-copaNeo-6B (QA + WS)#28Accuracy: 84.0
question-answering-on-copaNeo-6B (few-shot)#37Accuracy: 77.0
question-answering-on-copaNeo-6B (QA)#46Accuracy: 58.2
question-answering-on-multircNeo-6B (QA + WS)#15F1: 63.8
question-answering-on-multircNeo-6B (few-shot)#18F1: 60.8
question-answering-on-multircNeo-6B (QA)#20F1: 58.8
question-answering-on-natural-questionsNeo-6B (QA)#34EM: 19.7
question-answering-on-natural-questionsNeo-6B (QA + WS)#35EM: 19.6
question-answering-on-natural-questionsNeo-6B (Few-Shot)#36EM: 13.7
question-answering-on-story-clozeNeo-6B (QA + WS)#1Accuracy: 87.8
question-answering-on-story-clozeNeo-6B (QA)#6Accuracy: 76.3
question-answering-on-story-clozeNeo-6B (few-shot)#7Accuracy: 51.0