GPT-4 Technical Report

Benchmark Model Rank Results
answerability-prediction-on-peerqaGPT-4o-2024-08-06#4Macro F1: 0.3087
arithmetic-reasoning-on-gsm8kGPT-3.5 (few-shot, k=5)#85Accuracy: 57.1
common-sense-reasoning-on-arc-challengeGPT-4 (few-shot, k=25)#1Accuracy: 96.4
common-sense-reasoning-on-arc-challengeGPT-3.5 (few-shot, k=25)#4Accuracy: 85.2
common-sense-reasoning-on-winograndeGPT-4 (5-shot)#6Accuracy: 87.5
common-sense-reasoning-on-winograndeGPT-3.5 (5-shot)#13Accuracy: 81.6
factual-inconsistency-detection-in-chart-1GPT-4V#1Kendall's Tau-c: 0.205
few-shot-learning-on-medconceptsqagpt-4-0125-preview#1Accuracy: 61.911
fs-mevqa-on-smeGPT-4-1106-Vision-Preview#2BLEU-4: 45.51METEOR: 35.17ROUGE-L: 52.67CIDEr: 269.68
long-context-understanding-on-ada-levalGPT-4-Turbo-1106#11k: 74.02k: 73.54k: 67.56k: 59.58k: 53.512k: 49.5
long-context-understanding-on-ada-levalGPT-4-Turbo-0125#21k: 73.52k: 73.54k: 65.56k: 63.08k: 56.512k: 52.0
long-context-understanding-on-ada-leval-tsortGPT-4-Turbo-1106#12k: 18.54k: 15.58k: 7.516k: 3.532k: 6.064k: 6.0128k: 6.0
long-context-understanding-on-ada-leval-tsortGPT-4-Turbo-0125#22k: 15.54k: 16.58k: 8.516k: 5.532k: 2.064k: 4.0128k: 2.0
long-context-understanding-on-mmneedleGPT-4o#11 Image, 4*4 Stitching, Exact Accuracy: 83
long-context-understanding-on-mmneedleGPT-4V#21 Image, 4*4 Stitching, Exact Accuracy: 54.72
multi-task-language-understanding-on-mmluGPT-3.5 Turbo#7Average (%): 70.0
object-rearrangement-on-open6dor-v2GPT-4V#3pos-level1: 46.8pos-level0: 39.1rot-level0: 9.1rot-level1: 6.9
question-answering-on-drop-testGPT-4 (few-shot, k=3)#3F1: 80.9
question-answering-on-drop-testGPT 3.5 (few-shot, k=3)#8F1: 64.1
question-answering-on-peerqaGPT-4o-2024-08-06-128k#1Prometheus-2 Answer Correctness: 3.4612Rouge-L: 0.2266
question-answering-on-tiqGpt-4#3P@1: 28.6
question-answering-on-triviaqaGPT-4-0613 (Zero-shot)#3EM: 84.8
question-answering-on-truthfulqaGPT-4 (RLHF)#1MC1: 0.59
sentence-completion-on-hellaswagGPT-4 (10-shot)#4Accuracy: 95.3
sentence-completion-on-hellaswagGPT-3.5 (10-shot)#19Accuracy: 85.5
spatial-reasoning-on-embspatial-benchGPT-4V#3Generation: 36.07
task-1-grouping-on-ocwGPT-4 (5-shot)#1Wasserstein Distance (WD): 72.9# Correct Groups: 269
task-1-grouping-on-ocwGPT-4 (1-shot)#2Wasserstein Distance (WD): 73.4# Correct Groups: 262
task-1-grouping-on-ocwGPT-4 (100-shot)#3Wasserstein Distance (WD): 73.6# Correct Groups: 249
task-1-grouping-on-ocwGPT-4 (3-shot)#4Wasserstein Distance (WD): 73.7# Correct Groups: 272
task-1-grouping-on-ocwGPT-4 (0-shot)#5Wasserstein Distance (WD): 75.8# Correct Groups: 239
task-1-grouping-on-ocwGPT-3.5-turbo (5-shot)#6Wasserstein Distance (WD): 80.6# Correct Groups: 149
task-1-grouping-on-ocwGPT-3.5-turbo (3-shot)#7Wasserstein Distance (WD): 80.9# Correct Groups: 140
task-1-grouping-on-ocwGPT-3.5-turbo (10-shot)#8Wasserstein Distance (WD): 81.2# Correct Groups: 137
task-1-grouping-on-ocwGPT-3.5-turbo (1-shot)#9Wasserstein Distance (WD): 82.3# Correct Groups: 123
task-1-grouping-on-ocwGPT-3.5-turbo (0-shot)#10Wasserstein Distance (WD): 82.5# Correct Groups: 114
visual-question-answering-on-benchlmmGPT-4V#1GPT-3.5 score: 58.37
visual-question-answering-on-mm-vetGPT-4o (gpt-4o-2024-05-13)#7GPT-4 score: 69.3±0.1
visual-question-answering-on-mm-vetgpt-4o-mini-2024-07-18#9GPT-4 score: 68.6±0.1
visual-question-answering-on-mm-vetGPT-4V#10GPT-4 score: 67.7±0.3
visual-question-answering-on-mm-vetGPT-4V-Turbo-detail:high#11GPT-4 score: 67.6±0.1
visual-question-answering-on-mm-vetGPT-4V-Turbo-detail:low#31GPT-4 score: 60.2±0.3
visual-question-answering-on-mm-vet-v2GPT-4o (gpt-4o-2024-11-20)#1GPT-4 score: 72.1±0.2
visual-question-answering-on-mm-vet-v2GPT-4o (gpt-4o-2024-05-13)#2GPT-4 score: 71.0±0.2
visual-question-answering-on-mm-vet-v2gpt-4o-mini-2024-07-18#5GPT-4 score: 66.8±0.3
visual-question-answering-on-mm-vet-v2GPT-4 Turbo (gpt-4-0125-preview)#6GPT-4 score: 66.3±0.2
visual-question-answering-on-vip-benchGPT-4V-turbo-detail:high (Visual Prompt)#1GPT-4 score (bbox): 60.7GPT-4 score (human): 59.9
visual-question-answering-on-vip-benchGPT-4V-turbo-detail:low (Visual Prompt)#2GPT-4 score (bbox): 52.8GPT-4 score (human): 51.4
visual-question-answering-vqa-on-core-mmGPT-4V#1Overall score: 74.44Deductive: 74.86Abductive: 77.88
zero-shot-learning-on-medconceptsqagpt-4-0125-preview#1Accuracy: 52.489