Can LLMs Effectively Leverage Graph Structural Information through Prompts, and Why?
Open paper
Benchmark
Model
Rank
Results
text-to-sql-on-bird
GPT-4 (Baseline)
#6
Execution Accuracy % (Test): 54.89
Execution Accuracy % (Dev): 46.35
text-to-sql-on-bird
Claude-2 (Baseline)
#7
Execution Accuracy % (Test): 49.02
Execution Accuracy % (Dev): 42.70
Rank counts only results with a code link.