| Benchmark | Model | Rank | Results |
|---|---|---|---|
| code-generation-on-apps | Codex 12B (Raw) | #12 | Introductory Pass@1: 5.60%Interview Pass@1: 1.00%… |
| multi-task-language-understanding-on-bbh-alg | code-davinci-002 175B (CoT) | #1 | Average (%): 73.9 |
| multi-task-language-understanding-on-bbh-nlp | code-davinci-002 175B (CoT) | #3 | Average (%): 73.5 |