| answerability-prediction-on-peerqa | GPT-3.5-Turbo-0613-16k | #2 | Macro F1: 0.3304 |
| common-sense-reasoning-on-arc-challenge | GPT-3 175B (1 shot) | #20 | Accuracy: 53.2 |
| common-sense-reasoning-on-arc-challenge | GPT-3 175B (0-shot) | #22 | Accuracy: 51.4 |
| common-sense-reasoning-on-arc-easy | GPT-3 175B (1 shot) | #26 | Accuracy: 71.2 |
| common-sense-reasoning-on-arc-easy | GPT-3 175B (0-shot) | #33 | Accuracy: 68.8 |
| common-sense-reasoning-on-record | GPT-3 Large 760M (0-shot) | #9 | EM: 82.1 |
| common-sense-reasoning-on-winogrande | GPT-3 175B (0-shot) | #35 | Accuracy: 70.2 |
| common-sense-reasoning-on-winogrande | GPT-3 Large 760M (0-shot) | #53 | Accuracy: 57.4 |
| coreference-resolution-on-winograd-schema | GPT-3 175B (few-shot) | #18 | Accuracy: 80.1 |
| few-shot-learning-on-medconceptsqa | gpt-3.5-turbo | #2 | Accuracy: 41.476 |
| language-modelling-on-lambada | GPT-3 175B (Few-Shot) | #3 | Accuracy: 86.4Perplexity: 1.92 |
| language-modelling-on-lambada | GPT-3 175B (Zero-Shot) | #13 | Accuracy: 76.2Perplexity: 3.00 |
| language-modelling-on-lambada | GPT-3 13B (Zero-Shot) | #15 | Accuracy: 72.5Perplexity: 3.56 |
| language-modelling-on-lambada | GPT-3 6.7B (Zero-Shot) | #18 | Accuracy: 70.3Perplexity: 4.00 |
| language-modelling-on-lambada | GPT-3 2.7B (Zero-Shot) | #22 | Accuracy: 67.1Perplexity: 4.60 |
| language-modelling-on-penn-treebank-word | GPT-3 (Zero-Shot) | #1 | Test perplexity: 20.5Params: 175000M |
| natural-language-inference-on-anli-test | GPT-3 | #11 | A1: 36.8A2: 34A3: 40.2 |
| natural-language-inference-on-commitmentbank | GPT-3 175B (Few-Shot) | #11 | Accuracy: 75.6 |
| natural-language-inference-on-commitmentbank | GPT-3 175B (few-shot, k=32) | #18 | F1: 52 |
| natural-language-inference-on-rte | GPT-3 175B (few-shot, k=32) | #50 | Accuracy: 69% |
| question-answering-on-boolq | GPT-3 175B (few-shot, k=32) | #32 | Accuracy: 76.4 |
| question-answering-on-boolq | GPT-3 75B (0-shot) | #53 | Accuracy: 60.5 |
| question-answering-on-copa | GPT-3 175B (few-shot, k=32) | #10 | Accuracy: 92 |
| question-answering-on-copa | GPT-3 175B (0-shot) | #11 | Accuracy: 91 |
| question-answering-on-copa | GPT-3 175B (1-shot) | #20 | Accuracy: 87 |
| question-answering-on-copa | GPT-3 13B (few-shot, k=32) | #23 | Accuracy: 86 |
| question-answering-on-copa | GPT-3 Large 760M (0-shot) | #40 | Accuracy: 73.0 |
| question-answering-on-coqa | GPT-3 175B (few-shot, k=32) | #7 | Overall: 85 |
| question-answering-on-drop-test | GPT-3 175B (few-shot, k=32) | #10 | F1: 36.5 |
| question-answering-on-multirc | GPT-3 175B (Few-Shot) | #11 | F1: 75.4 |
| question-answering-on-natural-questions | GPT-3 175B (Few-Shot, k=64) | #27 | EM: 29.9 |
| question-answering-on-obqa | GPT-3 175B (zero-shot) | #5 | Accuracy: 57.6 |
| question-answering-on-openbookqa | GPT-3 175B (few-shot, k=32) | #13 | Accuracy: 65.4 |
| question-answering-on-peerqa | GPT-3.5-Turbo-0613-16k | #5 | Prometheus-2 Answer Correctness: 3.0408Rouge-L: 0.2414… |
| question-answering-on-piqa | GPT-3 175B (0-shot) | #28 | Accuracy: 81.0 |
| question-answering-on-piqa | GPT-3 Large 760M (0-shot) | #50 | Accuracy: 72.9 |
| question-answering-on-race | GPT-3 175B (few-shot, k=32) | #3 | RACE-m: 58.1 |
| question-answering-on-race | GPT-3 175B (Few-Shot) | #4 | RACE-h: 46.8 |
| question-answering-on-story-cloze | GPT-3 175B (Few-Shot) | #2 | Accuracy: 87.7 |
| question-answering-on-storycloze | GPT-3 Large 760M (zero-shot) | #14 | Accuracy: 72.4 |
| question-answering-on-triviaqa | GPT-3 175B (Few-Shot) | #17 | EM: 71.2 |
| question-answering-on-webquestions | Few-shot | #6 | EM: 44.7 |
| question-answering-on-webquestions | GPT-3-175B (Few-Shot) | #15 | EM: 41.5 |
| question-answering-on-webquestions | GPT-3-175B (One-Shot) | #26 | EM: 25.3 |
| question-answering-on-webquestions | GPT-3-175B (Zero-Shot) | #29 | EM: 14.4 |
| reading-comprehension-on-race | GPT-3 175B (0-shot) | #14 | Accuracy (Middle): 58.4 |
| reading-comprehension-on-race | GPT-3 175B (zero-shot) | #20 | Accuracy (High): 45.5 |
| sentence-completion-on-hellaswag | GPT-3 175B (few-shot, k=32) | #36 | Accuracy: 79.3 |
| sentence-completion-on-hellaswag | GPT-3 (0-shot) | #39 | Accuracy: 78.9 |
| sentence-completion-on-hellaswag | GPT-3 Large 760M (0-shot) | #53 | Accuracy: 51.0 |
| unsupervised-machine-translation-on-wmt2014-1 | GPT-3 175B (Few-Shot) | #1 | BLEU: 39.2 |
| unsupervised-machine-translation-on-wmt2014-2 | GPT-3 175B (Few-Shot) | #5 | BLEU: 32.6 |
| unsupervised-machine-translation-on-wmt2016 | GPT-3 175B (Few-Shot) | #1 | BLEU: 29.7 |
| unsupervised-machine-translation-on-wmt2016-1 | GPT-3 175B (Few-Shot) | #1 | BLEU: 40.6 |
| word-sense-disambiguation-on-words-in-context | GPT-3 175B (few-shot, k=32) | #25 | Accuracy: 49.4 |
| zero-shot-learning-on-medconceptsqa | gpt-3.5-turbo | #2 | Accuracy: 37.058 |