Code Llama: Open Foundation Models for Code

Benchmark Model Rank Results
code-generation-on-mbppCode Llama - Python 70B (3-shot)#29Accuracy: 65.5
code-generation-on-mbppCode Llama 70B (3-shot)#32Accuracy: 62.4
code-generation-on-mbppCode Llama - Instruct 70B (3-shot)#33Accuracy: 62.2
code-generation-on-mbppUnnatural Code Llama 34B (3-shot)#36Accuracy: 61.2
code-generation-on-mbppCode Llama - Instruct 34B (3-shot)#40Accuracy: 57
code-generation-on-mbppCode Llama - Python 34B (3-shot)#41Accuracy: 56.2
code-generation-on-mbppCode Llama 34B (3-shot)#43Accuracy: 55
code-generation-on-mbppGPT-3.5 Turbo#46Accuracy: 52.2
code-generation-on-mbppCode Llama - Instruct 13B (3-shot)#50Accuracy: 49.4
code-generation-on-mbppCode Llama - Python 13B (3-shot)#53Accuracy: 49
code-generation-on-mbppCode Llama - Python 7B (3-shot)#56Accuracy: 47.6
code-generation-on-mbppCode Llama 13B (3-shot)#61Accuracy: 47
code-generation-on-mbppCode Llama - Instruct 7B (3-shot)#66Accuracy: 44.4
code-generation-on-mbppCode Llama 7B (3-shot)#70Accuracy: 41.4