Planning-Driven Programming: A Large Language Model Programming Workflow

Benchmark Model Rank Results
code-generation-on-appsLPW (GPT-4o)#1Introductory Pass@1: 87.2Interview Pass@1: 65.2
code-generation-on-codecontestsLPW (GPT-4o)#2Test Set pass@1: 34.7
code-generation-on-humanevalPhi-2#2Pass@1: 98.2
code-generation-on-livecodebenchLPW (GPT-4o)#2Acc: 59.3
code-generation-on-mbppLPW (GPT-4o)#8Accuracy: 84.8