RES-Q: Evaluating Code-Editing Large Language Model Systems at the Repository Scale

Benchmark Model Rank Results
code-generation-on-res-qQurrentOS-coder + Claude 3.5 Sonnet#1pass@1: 58.0
code-generation-on-res-qQurrentOS-coder + GPT-4o#2pass@1: 46.0
code-generation-on-res-qQurrentOS-coder + GPT-4 Turbo#3pass@1: 37.0
code-generation-on-res-qQurrentOS-coder + Claude 3 Opus#4pass@1: 36.0
code-generation-on-res-qQurrentOS-coder + GPT-4#5pass@1: 30.0
code-generation-on-res-qQurrentOS-coder + Gemini 1.5 Pro#6pass@1: 30.0
code-generation-on-res-qQurrentOS-coder + DeepSeek-Coder-V2#7pass@1: 29.0
code-generation-on-res-qQurrentOS-coder + Llama 3 70b#8pass@1: 20.0
code-generation-on-res-qQurrentOS-coder + Qwen-72B-Instruct#9pass@1: 18.0