| Benchmark | Model | Rank | Results |
|---|---|---|---|
| text-to-sql-on-bird | CoT + ChatGPT | #8 | Execution Accuracy % (Test): 40.08Execution Accuracy % (Dev): 36.64 |
| text-to-sql-on-bird | ChatGPT (Baseline) | #9 | Execution Accuracy % (Test): 39.30Execution Accuracy % (Dev): 37.22 |
| text-to-sql-on-bird | Codex (Baseline) | #10 | Execution Accuracy % (Test): 36.47Execution Accuracy % (Dev): 34.35 |
| text-to-sql-on-bird | Palm-2 (Baseline) | #11 | Execution Accuracy % (Test): 33.04Execution Accuracy % (Dev): 27.38 |
| text-to-sql-on-bird | Human Performance | #14 | Execution Accurarcy (Human): 92.96 |