The CoT Collection: Improving Zero-shot and Few-shot Learning of Language Models via Chain-of-Thought Fine-Tuning

Benchmark Model Rank Results
common-sense-reasoning-on-winograndeT0-3B (CoT fine-tuned)#52Accuracy: 57.5
coreference-resolution-on-winograd-schemaT0-3B (CoT fine-tuned)#36Accuracy: 66
natural-language-inference-on-anli-testT0-3B (CoT fine-tuned)#9A1: 41.7A2: 37.2A3: 41.9
natural-language-inference-on-rteT0-3B (CoT fine-tuned)#29Accuracy: 80.8%
question-answering-on-copaT0-3B (CoT fine-tuned)#14Accuracy: 90.9
question-answering-on-pubmedqaCoT-T5-11B (1024 Shot)#16Accuracy: 73.42
question-answering-on-storyclozeT0-3B (CoT fine-tuned)#4Accuracy: 94.5
sentence-completion-on-hellaswagT0-3B (CoT fine-tuned)#61Accuracy: 41.1
word-sense-disambiguation-on-words-in-contextT0-3B (CoT fine-tuned)#12Accuracy: 56.7