The Claude 3 Model Family: Opus, Sonnet, Haiku

Benchmark Model Rank Results
arithmetic-reasoning-on-gsm8kClaude 3 Haiku (0-shot chain-of-thought)Accuracy: 88.9
arithmetic-reasoning-on-gsm8kClaude 3 Opus (0-shot chain-of-thought)Accuracy: 95
arithmetic-reasoning-on-gsm8kClaude 3 Sonnet (0-shot chain-of-thought)Accuracy: 92.3
code-generation-on-mbppClaude 3 HaikuAccuracy: 80.4
code-generation-on-mbppClaude 3 OpusAccuracy: 86.4
code-generation-on-mbppClaude 3 SonnetAccuracy: 79.4
common-sense-reasoning-on-winograndeClaude 3 Haiku (5-shot)Accuracy: 74.2
common-sense-reasoning-on-winograndeClaude 3 Opus (5-shot)Accuracy: 88.5
common-sense-reasoning-on-winograndeClaude 3 Sonnet (5-shot)Accuracy: 75.1
long-context-understanding-on-mmneedleClaude 3 Opus1 Image, 4*4 Stitching, Exact Accuracy: 12.3
multi-task-language-understanding-on-mmluClaude 3 Haiku (5-shot)Average (%): 75.2
multi-task-language-understanding-on-mmluClaude 3 Sonnet (5-shot)Average (%): 79
question-answering-on-pubmedqaClaude 3 Opus (5-shot)Accuracy: 75.8
question-answering-on-pubmedqaClaude 3 Opus (zero-shot)Accuracy: 74.9