Evaluation of LLMs on Syntax-Aware Code Fill-in-the-Middle Tasks

Benchmark Model Rank Results
code-completion-on-safimdeepseek-coder-33b-base#1Average: 69.01Algorithmic: 60.78Control: 71.10API: 75.16
code-completion-on-safimdeepseek-coder-6.7b-base#2Average: 63.40Algorithmic: 54.74Control: 65.79API: 69.68
code-completion-on-safimstarcoderbase#3Average: 55.54Algorithmic: 44.11Control: 54.46API: 68.06
code-completion-on-safimgpt-4-1106-preview#4Average: 53.28Algorithmic: 42.11Control: 55.15API: 62.58
code-completion-on-safimCodeLlama-13b-hf#5Average: 52.78Algorithmic: 41.41Control: 57.25API: 59.68
code-completion-on-safimdeepseek-coder-1.3b-base#6Average: 52.63Algorithmic: 41.20Control: 54.10API: 62.58
code-completion-on-safimCodeLlama-34b-hf#7Average: 49.66Algorithmic: 38.55Control: 53.98API: 56.45
code-completion-on-safimCodeLlama-7b-hf#8Average: 45.00Algorithmic: 34.68Control: 53.56API: 46.77
code-completion-on-safimgpt-3.5-turbo-0301#9Average: 40.86Algorithmic: 31.24Control: 37.48API: 53.87
code-completion-on-safimincoder-6B#10Average: 33.79Algorithmic: 25.16Control: 28.16API: 48.06
code-completion-on-safimcodegen-16B-multi#11Average: 30.99Algorithmic: 25.94Control: 35.74API: 31.29
code-completion-on-safimcodegen-2B-multi#12Average: 29.55Algorithmic: 23.49Control: 32.89API: 32.26
code-completion-on-safimincoder-1B#13Average: 29.27Algorithmic: 21.06Control: 22.89API: 43.87
code-completion-on-safimcodegen-6B-multi#14Average: 28.71Algorithmic: 23.60Control: 34.80API: 27.74
code-completion-on-safimcodegen-350M-multi#15Average: 22.94Algorithmic: 16.30Control: 26.06API: 26.45