Math Word Problem Solving by Generating Linguistic Variants of Problem Statements

Benchmark Model Rank Results
math-word-problem-solving-on-mawpsDeBERTa (PM + VM)#8Accuracy (%): 91.0
math-word-problem-solving-on-mawpsGPT-3.5 turbo (175B)#16Accuracy (%): 80.3
math-word-problem-solving-on-mawpsGPT-J#17Accuracy (%): 9.9
math-word-problem-solving-on-mawpsGPT-3 text-curie-001 (13B)#18Accuracy (%): 4.09
math-word-problem-solving-on-mawpsGPT-3 text-babbage-001 (6.7B)#19Accuracy (%): 2.76
math-word-problem-solving-on-paramawpsDeBERTa (VM)#1Accuracy (%): 79.1
math-word-problem-solving-on-paramawpsGPT-3.5 Turbo (175B)#3Accuracy (%): 73.0
math-word-problem-solving-on-paramawpsGPT-J (6B)#4Accuracy (%): 5.9
math-word-problem-solving-on-paramawpsGPT-3 text-curie-001 (13B)#5Accuracy (%): 4.20
math-word-problem-solving-on-paramawpsGPT-3 text-babbage-001 (6.7B)#6Accuracy (%): 3.21
math-word-problem-solving-on-svampDeBERTa#12Execution Accuracy: 63.5Accuracy: 63.5