| arithmetic-reasoning-on-gsm8k | LLaMA 65B-maj1@k | #73 | Accuracy: 69.7Parameters (Billion): 65 |
| arithmetic-reasoning-on-gsm8k | LLaMA 33B-maj1@k | #92 | Accuracy: 53.1Parameters (Billion): 33 |
| arithmetic-reasoning-on-gsm8k | LLaMA 65B | #98 | Accuracy: 50.9Parameters (Billion): 65 |
| arithmetic-reasoning-on-gsm8k | LLaMA 33B | #103 | Accuracy: 35.6Parameters (Billion): 33 |
| arithmetic-reasoning-on-gsm8k | LLaMA 13B-maj1@k | #106 | Accuracy: 29.3Parameters (Billion): 13 |
| arithmetic-reasoning-on-gsm8k | LLaMA 7B (maj1@k) | #109 | Accuracy: 18.1Parameters (Billion): 7 |
| arithmetic-reasoning-on-gsm8k | LLaMA 13B | #111 | Accuracy: 17.8Parameters (Billion): 13 |
| arithmetic-reasoning-on-gsm8k | LLaMA 7B | #113 | Accuracy: 11.0Parameters (Billion): 7 |
| code-generation-on-mbpp | LLaMA 65B (0-shot) | #74 | Accuracy: 37.7 |
| code-generation-on-mbpp | LLaMA 33B (0-shot) | #80 | Accuracy: 30.2 |
| code-generation-on-mbpp | LLaMA 13B (0-shot) | #85 | Accuracy: 22 |
| code-generation-on-mbpp | LLaMA 7B (0-shot) | #88 | Accuracy: 17.7 |
| common-sense-reasoning-on-arc-challenge | LLaMA 33B (zero-shot) | #16 | Accuracy: 57.8 |
| common-sense-reasoning-on-arc-challenge | LLaMA 65B (zero-shot) | #18 | Accuracy: 56.0 |
| common-sense-reasoning-on-arc-challenge | LLaMA 13B (zero-shot) | #21 | Accuracy: 52.7 |
| common-sense-reasoning-on-arc-challenge | LLaMA 7B (zero-shot) | #27 | Accuracy: 47.6 |
| common-sense-reasoning-on-arc-easy | LLaMA 33B (0-shot) | #13 | Accuracy: 80.0 |
| common-sense-reasoning-on-arc-easy | LLaMA 65B (0-shot) | #16 | Accuracy: 78.9 |
| common-sense-reasoning-on-arc-easy | LLaMA 13B (0-shot) | #21 | Accuracy: 74.8 |
| common-sense-reasoning-on-arc-easy | LLaMA 7B (0-shot) | #23 | Accuracy: 72.8 |
| common-sense-reasoning-on-winogrande | LLaMA 65B (0-shot) | #22 | Accuracy: 77.0 |
| common-sense-reasoning-on-winogrande | LLaMA 33B (0-shot) | #24 | Accuracy: 76.0 |
| common-sense-reasoning-on-winogrande | LLaMA 13B (0-shot) | #30 | Accuracy: 73.0 |
| common-sense-reasoning-on-winogrande | LLaMA 7B (0-shot) | #37 | Accuracy: 70.1 |
| few-shot-learning-on-medconceptsqa | meta-llama/Meta-Llama-3-8B-Instruct | #3 | Accuracy: 25.653 |
| math-word-problem-solving-on-math | LLaMA 65B (maj1@k) | #88 | Accuracy: 20.5Parameters (Billions): 65 |
| math-word-problem-solving-on-math | LLaMA 33B-maj1@k | #94 | Accuracy: 15.2Parameters (Billions): 33 |
| math-word-problem-solving-on-math | LLaMA 65B | #102 | Accuracy: 10.6Parameters (Billions): 65 |
| math-word-problem-solving-on-math | LLaMA 13B-maj1@k | #105 | Accuracy: 8.8Parameters (Billions): 13 |
| math-word-problem-solving-on-math | LLaMA 33B | #106 | Accuracy: 7.1Parameters (Billions): 33 |
| math-word-problem-solving-on-math | LLaMA 7B-maj1@k | #108 | Accuracy: 6.9Parameters (Billions): 7 |
| math-word-problem-solving-on-math | LLaMA 13B | #117 | Accuracy: 3.9Parameters (Billions): 13 |
| math-word-problem-solving-on-math | LLaMA 7B | #120 | Accuracy: 2.9Parameters (Billions): 7 |
| multi-task-language-understanding-on-mmlu | LLaMA 65B (fine-tuned) | #8 | Average (%): 68.9 |
| multi-task-language-understanding-on-mmlu | LLaMA 65B (5-shot) | #10 | Average (%): 63.4 |
| multi-task-language-understanding-on-mmlu | LLaMA 33B (5-shot) | #15 | Average (%): 57.8 |
| question-answering-on-boolq | LLaMA 65B (0-shot) | #15 | Accuracy: 85.3 |
| question-answering-on-boolq | LLaMA 33B (0-shot) | #21 | Accuracy: 83.1 |
| question-answering-on-boolq | LLaMA 13B (zero-shot) | #27 | Accuracy: 78.1 |
| question-answering-on-boolq | LLaMA 7B (zero-shot) | #30 | Accuracy: 76.5 |
| question-answering-on-natural-questions | LLaMA 65B (few-shot, k=64) | #18 | EM: 39.9 |
| question-answering-on-natural-questions | LLaMA 65B (few-shot, k=5) | #22 | EM: 35.0 |
| question-answering-on-natural-questions | LLaMA 65B (one-shot) | #26 | EM: 31.0 |
| question-answering-on-natural-questions | LLaMA 33B (zero-shot) | #32 | EM: 24.9 |
| question-answering-on-obqa | LLaMA 65B (zero-shot) | #3 | Accuracy: 60.2 |
| question-answering-on-obqa | LLaMA 33B (zero-shot) | #4 | Accuracy: 58.6 |
| question-answering-on-obqa | LLaMA 7B (zero-shot) | #6 | Accuracy: 57.2 |
| question-answering-on-obqa | LLaMA 13B (zero-shot) | #7 | Accuracy: 56.4 |
| question-answering-on-piqa | LLaMA 65B (0-shot) | #16 | Accuracy: 82.8 |
| question-answering-on-piqa | LLaMA 33B (0-shot) | #19 | Accuracy: 82.3 |
| question-answering-on-piqa | LLaMA 13B (0-shot) | #32 | Accuracy: 80.1 |
| question-answering-on-piqa | LLaMA 7B (0-shot) | #33 | Accuracy: 79.8 |
| question-answering-on-social-iqa | LLaMA 65B (zero-shot) | #18 | Accuracy: 52.3 |
| question-answering-on-social-iqa | LLaMA 13B (zero-shot) | #21 | Accuracy: 50.4 |
| question-answering-on-social-iqa | LLaMA 33B (zero-shot) | #22 | Accuracy: 50.4 |
| question-answering-on-social-iqa | LLaMA 7B (zero-shot) | #23 | Accuracy: 48.9 |
| question-answering-on-timequestions | Llama3 | #9 | P@1: 17.8 |
| question-answering-on-triviaqa | LLaMA 65B (few-shot, k=64) | #12 | EM: 73.0 |
| question-answering-on-triviaqa | LLaMA 65B (few-shot, k=5) | #13 | EM: 72.6 |
| question-answering-on-triviaqa | LLaMA 65B (one-shot) | #15 | EM: 71.6 |
| question-answering-on-triviaqa | LLaMA 65B (zero-shot) | #19 | EM: 68.2 |
| question-answering-on-truthfulqa | LLaMA 65B | #22 | % true: 57% info: 53 |
| question-answering-on-truthfulqa | LLaMA 33B | #23 | % true: 52% info: 48 |
| question-answering-on-truthfulqa | LLaMA 13B | #24 | % true: 47% info: 41 |
| question-answering-on-truthfulqa | LLaMA 7B | #25 | % true: 33% info: 29 |
| reading-comprehension-on-race | LLaMA 65B (zero-shot) | #9 | Accuracy (Middle): 67.9Accuracy (High): 51.6 |
| reading-comprehension-on-race | LLaMA 33B (zero-shot) | #11 | Accuracy (Middle): 64.1Accuracy (High): 48.3 |
| reading-comprehension-on-race | LLaMA 13B (zero-shot) | #12 | Accuracy (Middle): 61.6Accuracy (High): 47.2 |
| reading-comprehension-on-race | LLaMA 7B (zero-shot) | #13 | Accuracy (Middle): 61.1Accuracy (High): 46.9 |
| sentence-completion-on-hellaswag | LLaMA 65B (0-shot) | #21 | Accuracy: 84.2 |
| sentence-completion-on-hellaswag | LLaMA 33B (0-shot) | #28 | Accuracy: 82.8 |
| sentence-completion-on-hellaswag | LLaMA 13B (0-shot) | #38 | Accuracy: 79.2 |
| sentence-completion-on-hellaswag | LLaMA 7B (0-shot) | #41 | Accuracy: 76.1 |
| stereotypical-bias-analysis-on-crows-pairs | LLaMA 65B | #4 | Gender: 70.6Religion: 70.6Race/Color: 57.0Sexual Orientation: 81.0… |
| zero-shot-learning-on-medconceptsqa | meta-llama/Meta-Llama-3-8B-Instruct | #4 | Accuracy: 25.840 |