| coreference-resolution-on-winograd-schema | Flan-T5 XXL (zero -shot) | #8 | Accuracy: 89.82 |
| cross-lingual-question-answering-on-tydiqa | Flan-U-PaLM 540B (direct-prompting) | #2 | EM: 68.3 |
| cross-lingual-question-answering-on-tydiqa | Flan-PaLM 540B (direct-prompting) | #3 | EM: 67.8 |
| multi-task-language-understanding-on-bbh-alg | Flan-PaLM 540B (3-shot, fine-tuned, CoT + SC) | #2 | Average (%): 66.5 |
| multi-task-language-understanding-on-bbh-alg | PaLM 540B (CoT + self-consistency) | #3 | Average (%): 62.2 |
| multi-task-language-understanding-on-bbh-alg | Flan-PaLM 540B (3-shot, fine-tuned, CoT) | #4 | Average (%): 61.3 |
| multi-task-language-understanding-on-bbh-alg | PaLM 540B (CoT) | #5 | Average (%): 57.6 |
| multi-task-language-understanding-on-bbh-alg | Flan-PaLM 540B (3-shot, fine-tuned) | #6 | Average (%): 48.2 |
| multi-task-language-understanding-on-bbh-alg | PaLM 540B | #7 | Average (%): 38.3 |
| multi-task-language-understanding-on-bbh-nlp | Flan-PaLM 540B (3-shot, fine-tuned, CoT + SC) | #1 | Average (%): 78.4 |
| multi-task-language-understanding-on-bbh-nlp | PaLM 540B (CoT + self-consistency) | #2 | Average (%): 78.2 |
| multi-task-language-understanding-on-bbh-nlp | Flan-PaLM 540B (3-shot, fine-tuned, CoT) | #4 | Average (%): 72.4 |
| multi-task-language-understanding-on-bbh-nlp | PaLM 540B (CoT) | #5 | Average (%): 71.2 |
| multi-task-language-understanding-on-bbh-nlp | Flan-PaLM 540B (5-shot, finetuned) | #6 | Average (%): 70.0 |
| multi-task-language-understanding-on-bbh-nlp | PaLM 540B | #7 | Average (%): 62.7 |
| multi-task-language-understanding-on-mgsm | Flan-PaLM 540B (8-shot, fine-tuned, CoT + SC) | #3 | Average (%): 72.0 |
| multi-task-language-understanding-on-mgsm | Flan-U-PaLM 540B (CoT) | #4 | Average (%): 60.4 |
| multi-task-language-understanding-on-mgsm | Flan-PaLM 540B (8-shot, fine-tuned, CoT) | #5 | Average (%): 57.0 |
| multi-task-language-understanding-on-mgsm | text-davinci-003 | #7 | Average (%): 36 |
| multi-task-language-understanding-on-mgsm | code-davinci-002 | #8 | Average (%): 35 |
| multi-task-language-understanding-on-mgsm | text-davinci-002 | #9 | Average (%): 23.7 |
| multi-task-language-understanding-on-mgsm | Flan-PaLM 540B (8-shot, fine-tuned) | #10 | Average (%): 21.2 |
| multi-task-language-understanding-on-mgsm | GPT-3 Davinci 175B | #11 | Average (%): 5.7 |
| multi-task-language-understanding-on-mmlu | llama 2(65b) | #4 | Average (%): 73.5 |
| multi-task-language-understanding-on-mmlu | GPT-3 Davinci 175B (CoT) | #14 | Average (%): 59.5 |
| multi-task-language-understanding-on-mmlu | Flan-T5-XL 3B (CoT) | #20 | Average (%): 45.5 |
| multi-task-language-understanding-on-mmlu | Flan-T5-Large 780M | #22 | Average (%): 45.1 |
| multi-task-language-understanding-on-mmlu | Flan-T5-Large 780M (CoT) | #24 | Average (%): 40.5 |
| multi-task-language-understanding-on-mmlu | GPT-3 Davinci 175B (5-shot) | #25 | Average (%): 39.7 |
| multi-task-language-understanding-on-mmlu | Flan-T5-Base 250M | #31 | Average (%): 35.9 |
| multi-task-language-understanding-on-mmlu | Flan-T5-Base 250M (CoT) | #32 | Average (%): 33.7 |
| multi-task-language-understanding-on-mmlu | Flan-T5-Small 80M | #35 | Average (%): 28.7 |