How Does Naming Affect LLMs on Code Analysis Tasks?

Benchmark Model Rank Results
code-generation-on-mbppBard (PaLM 2/chat-bison-001)Accuracy: 76.2
code-generation-on-mbppClaudeAccuracy: 71.4
code-generation-on-mbppGPT-3.5 Turbo (ChatGPT)Accuracy: 83.2
code-generation-on-mbppGPT-4 (Bing Chat)Accuracy: 82
code-generation-on-mbppGPT-4 (ChatGPT Plus)Accuracy: 87.5