From Code to Correctness: Closing the Last Mile of Code Generation with Hierarchical Debugging
Open paper
Benchmark
Model
Rank
Results
code-generation-on-humaneval
DeepSeek-Coder-V2-Lite (MGDebugger)
#7
Pass@1: 94.5
code-generation-on-mbpp
MGDebugger (DeepSeek-V3-0324)
#3
Accuracy: 92.4
code-generation-on-mbpp
MGDebugger (CodeQwen1.5)
#14
Accuracy: 80.8
Rank counts only results with a code link.