| A Multi-Agent Approach for Claim Verification from Tabular Data Documents | | 0.7300 | Qwen-235B + CoT (baseline) | 2026-04-19 |
| A Multi-Agent Approach for Claim Verification from Tabular Data Documents | | 0.7100 | MACE (Qwen-235B, Pm + Em + Vm) | 2026-04-19 |
| A Multi-Agent Approach for Claim Verification from Tabular Data Documents | | 0.6700 | MACE (Qwen-72B, Pm + Em + Vm) | 2026-04-19 |
| A Multi-Agent Approach for Claim Verification from Tabular Data Documents | | 0.6500 | MACE (LLaMA-8B, Pm + Em + Vm) | 2026-04-19 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.6480 | GPT-4 (zero-shot) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.6321 | GPT-4 (3-shot in-context) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.6277 | GPT-4 + CoT (3-shot in-context) | 2023-05-22 |
| A Multi-Agent Approach for Claim Verification from Tabular Data Documents | | 0.5800 | MACE (Mistral-7B, Pm + Em + Vm) | 2026-04-19 |
| Boosting large-language models for fact-checking: leveraging verbalized tabular data as evidence | ✓ Link | 0.4520 | TabV4FC (Qwen 2.5 - 72B) | 2026-03-19 |
| ProTrix: Building Models for Planning and Reasoning over Tables with Sentence Context | ✓ Link | 0.4500 | ProTrix | 2024-03-04 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.4260 | InstructGPT + CoT (3-shot in-context) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.4158 | InstructGPT (3-shot in-context) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.4141 | InstructGPT (zero-shot) | 2023-05-22 |
| ProTrix: Building Models for Planning and Reasoning over Tables with Sentence Context | ✓ Link | 0.4120 | ProTrix-Coder | 2024-03-04 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.3805 | Flan-T5-XL (zero-shot) | 2023-05-22 |
| Boosting large-language models for fact-checking: leveraging verbalized tabular data as evidence | ✓ Link | 0.3743 | TabV4FC (Qwen 2.5 - 14B) | 2026-03-19 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.3718 | LLaMA-13B (zero-shot) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.3516 | Vicuna-13B (3-shot in-context) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.3491 | Flan-T5-XXL (zero-shot) | 2023-05-22 |
| Boosting large-language models for fact-checking: leveraging verbalized tabular data as evidence | ✓ Link | 0.3449 | TabV4FC (LLaMA 3.3 - 70B) | 2026-03-19 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.3430 | TAPEX-Zero-XL (zero-shot) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.3426 | Vicuna-7B (3-shot in-context) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.3404 | Flan-T5-XXL (3-shot in-context) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.3266 | LLaMA-13B (3-shot in-context) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.3255 | Flan-T5-large (zero-shot) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.3247 | Vicuna-7B (zero-shot) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.3226 | LLaMA-7B (zero-shot) | 2023-05-22 |
| Boosting large-language models for fact-checking: leveraging verbalized tabular data as evidence | ✓ Link | 0.3223 | TabV4FC (DeepSeekR1-Qwen 32B) | 2026-03-19 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.2972 | TAPEX-Zero-large (zero-shot) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.2963 | Vicuna-13B (zero-shot) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.2921 | Flan-T5-XL (3-shot in-context) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.2895 | Alpaca-7B (3-shot in-context) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.2759 | Alpaca-7B (zero-shot) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.2730 | Flan-T5-large (3-shot in-context) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.2717 | LLaMA-7B (3-shot in-context) | 2023-05-22 |
| Boosting large-language models for fact-checking: leveraging verbalized tabular data as evidence | ✓ Link | 0.2698 | TabV4FC (DeepSeekR1-LLaMA 70B) | 2026-03-19 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.2656 | Flan-T5-base (zero-shot) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.2562 | TAPEX-Zero-XL (3-shot in-context) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.2409 | Flan-T5-base (3-shot in-context) | 2023-05-22 |
| SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables | | 0.2347 | TAPEX-Zero-large (3-shot in-context) | 2023-05-22 |
| GLEAN: Grounded Lightweight Evaluation Anchors for Contamination-Aware Tabular Reasoning | | 0.1970 | DeBERTa-v3 (GLEAN protocol) | 2026-01-22 |
| Boosting large-language models for fact-checking: leveraging verbalized tabular data as evidence | ✓ Link | 0.1739 | TabV4FC (Qwen 2.5 - 32B) | 2026-03-19 |