LEVER: Learning to Verify Language-to-Code Generation with Execution

Benchmark Model Rank Results
arithmetic-reasoning-on-gsm8kcode-davinci-002 175B (LEVER, 8-shot)#34Accuracy: 84.5Parameters (Billion): 175
code-generation-on-mbppcode-davinci-002 175B + LEVER#22Accuracy: 68.9
semantic-parsing-on-spidercode-davinci-002 175B (LEVER)#2Accuracy: 81.9
semantic-parsing-on-wikitablequestionsLEVER#10Accuracy (Test): 65.8Accuracy (Dev): 64.6
text-to-sql-on-spidercode-davinci-002 175B (LEVER)#14Execution Accuracy (Dev): 81.9