How Reasonable are Common-Sense Reasoning Tasks: A Case-Study on the Winograd Schema Challenge and SWAG

Benchmark Model Rank Results
coreference-resolution-on-winograd-schemaGPT-2 Medium 774M (partial scoring)#31Accuracy: 69.2
coreference-resolution-on-winograd-schemaGPT-2 Medium 774M (full scoring)#37Accuracy: 64.5
coreference-resolution-on-winograd-schemaGPT-2 Small 117M (partial scoring)#45Accuracy: 61.5
coreference-resolution-on-winograd-schemaGPT-2 Small 117M (full scoring)#54Accuracy: 55.7