| answerability-prediction-on-peerqa | GPT-4o-2024-08-06 | #4 | Macro F1: 0.3087 |
| arithmetic-reasoning-on-gsm8k | GPT-3.5 (few-shot, k=5) | #85 | Accuracy: 57.1 |
| common-sense-reasoning-on-arc-challenge | GPT-4 (few-shot, k=25) | #1 | Accuracy: 96.4 |
| common-sense-reasoning-on-arc-challenge | GPT-3.5 (few-shot, k=25) | #4 | Accuracy: 85.2 |
| common-sense-reasoning-on-winogrande | GPT-4 (5-shot) | #6 | Accuracy: 87.5 |
| common-sense-reasoning-on-winogrande | GPT-3.5 (5-shot) | #13 | Accuracy: 81.6 |
| factual-inconsistency-detection-in-chart-1 | GPT-4V | #1 | Kendall's Tau-c: 0.205 |
| few-shot-learning-on-medconceptsqa | gpt-4-0125-preview | #1 | Accuracy: 61.911 |
| fs-mevqa-on-sme | GPT-4-1106-Vision-Preview | #2 | BLEU-4: 45.51METEOR: 35.17ROUGE-L: 52.67CIDEr: 269.68… |
| long-context-understanding-on-ada-leval | GPT-4-Turbo-1106 | #1 | 1k: 74.02k: 73.54k: 67.56k: 59.58k: 53.512k: 49.5… |
| long-context-understanding-on-ada-leval | GPT-4-Turbo-0125 | #2 | 1k: 73.52k: 73.54k: 65.56k: 63.08k: 56.512k: 52.0… |
| long-context-understanding-on-ada-leval-tsort | GPT-4-Turbo-1106 | #1 | 2k: 18.54k: 15.58k: 7.516k: 3.532k: 6.064k: 6.0128k: 6.0 |
| long-context-understanding-on-ada-leval-tsort | GPT-4-Turbo-0125 | #2 | 2k: 15.54k: 16.58k: 8.516k: 5.532k: 2.064k: 4.0128k: 2.0 |
| long-context-understanding-on-mmneedle | GPT-4o | #1 | 1 Image, 4*4 Stitching, Exact Accuracy: 83… |
| long-context-understanding-on-mmneedle | GPT-4V | #2 | 1 Image, 4*4 Stitching, Exact Accuracy: 54.72… |
| multi-task-language-understanding-on-mmlu | GPT-3.5 Turbo | #7 | Average (%): 70.0 |
| object-rearrangement-on-open6dor-v2 | GPT-4V | #3 | pos-level1: 46.8pos-level0: 39.1rot-level0: 9.1rot-level1: 6.9… |
| question-answering-on-drop-test | GPT-4 (few-shot, k=3) | #3 | F1: 80.9 |
| question-answering-on-drop-test | GPT 3.5 (few-shot, k=3) | #8 | F1: 64.1 |
| question-answering-on-peerqa | GPT-4o-2024-08-06-128k | #1 | Prometheus-2 Answer Correctness: 3.4612Rouge-L: 0.2266… |
| question-answering-on-tiq | Gpt-4 | #3 | P@1: 28.6 |
| question-answering-on-triviaqa | GPT-4-0613 (Zero-shot) | #3 | EM: 84.8 |
| question-answering-on-truthfulqa | GPT-4 (RLHF) | #1 | MC1: 0.59 |
| sentence-completion-on-hellaswag | GPT-4 (10-shot) | #4 | Accuracy: 95.3 |
| sentence-completion-on-hellaswag | GPT-3.5 (10-shot) | #19 | Accuracy: 85.5 |
| spatial-reasoning-on-embspatial-bench | GPT-4V | #3 | Generation: 36.07 |
| task-1-grouping-on-ocw | GPT-4 (5-shot) | #1 | Wasserstein Distance (WD): 72.9# Correct Groups: 269… |
| task-1-grouping-on-ocw | GPT-4 (1-shot) | #2 | Wasserstein Distance (WD): 73.4# Correct Groups: 262… |
| task-1-grouping-on-ocw | GPT-4 (100-shot) | #3 | Wasserstein Distance (WD): 73.6# Correct Groups: 249… |
| task-1-grouping-on-ocw | GPT-4 (3-shot) | #4 | Wasserstein Distance (WD): 73.7# Correct Groups: 272… |
| task-1-grouping-on-ocw | GPT-4 (0-shot) | #5 | Wasserstein Distance (WD): 75.8# Correct Groups: 239… |
| task-1-grouping-on-ocw | GPT-3.5-turbo (5-shot) | #6 | Wasserstein Distance (WD): 80.6# Correct Groups: 149… |
| task-1-grouping-on-ocw | GPT-3.5-turbo (3-shot) | #7 | Wasserstein Distance (WD): 80.9# Correct Groups: 140… |
| task-1-grouping-on-ocw | GPT-3.5-turbo (10-shot) | #8 | Wasserstein Distance (WD): 81.2# Correct Groups: 137… |
| task-1-grouping-on-ocw | GPT-3.5-turbo (1-shot) | #9 | Wasserstein Distance (WD): 82.3# Correct Groups: 123… |
| task-1-grouping-on-ocw | GPT-3.5-turbo (0-shot) | #10 | Wasserstein Distance (WD): 82.5# Correct Groups: 114… |
| visual-question-answering-on-benchlmm | GPT-4V | #1 | GPT-3.5 score: 58.37 |
| visual-question-answering-on-mm-vet | GPT-4o (gpt-4o-2024-05-13) | #7 | GPT-4 score: 69.3±0.1 |
| visual-question-answering-on-mm-vet | gpt-4o-mini-2024-07-18 | #9 | GPT-4 score: 68.6±0.1 |
| visual-question-answering-on-mm-vet | GPT-4V | #10 | GPT-4 score: 67.7±0.3 |
| visual-question-answering-on-mm-vet | GPT-4V-Turbo-detail:high | #11 | GPT-4 score: 67.6±0.1 |
| visual-question-answering-on-mm-vet | GPT-4V-Turbo-detail:low | #31 | GPT-4 score: 60.2±0.3 |
| visual-question-answering-on-mm-vet-v2 | GPT-4o (gpt-4o-2024-11-20) | #1 | GPT-4 score: 72.1±0.2 |
| visual-question-answering-on-mm-vet-v2 | GPT-4o (gpt-4o-2024-05-13) | #2 | GPT-4 score: 71.0±0.2 |
| visual-question-answering-on-mm-vet-v2 | gpt-4o-mini-2024-07-18 | #5 | GPT-4 score: 66.8±0.3 |
| visual-question-answering-on-mm-vet-v2 | GPT-4 Turbo (gpt-4-0125-preview) | #6 | GPT-4 score: 66.3±0.2 |
| visual-question-answering-on-vip-bench | GPT-4V-turbo-detail:high (Visual Prompt) | #1 | GPT-4 score (bbox): 60.7GPT-4 score (human): 59.9 |
| visual-question-answering-on-vip-bench | GPT-4V-turbo-detail:low (Visual Prompt) | #2 | GPT-4 score (bbox): 52.8GPT-4 score (human): 51.4 |
| visual-question-answering-vqa-on-core-mm | GPT-4V | #1 | Overall score: 74.44Deductive: 74.86Abductive: 77.88… |
| zero-shot-learning-on-medconceptsqa | gpt-4-0125-preview | #1 | Accuracy: 52.489 |