Automatic Model Selection with Large Language Models for Reasoning
Open paper
Benchmark
Model
Rank
Results
math-word-problem-solving-on-svamp
GPT-4 (Model Selection)
#2
Execution Accuracy: 93.7
Rank counts only results with a code link.