Large Language Models are Temporal and Causal Reasoners for Video Question Answering
Open paper
Benchmark
Model
Rank
Results
video-question-answering-on-next-qa
LLaMA-VQA (33B)
#23
Accuracy: 75.5
video-question-answering-on-star
LLaMA-VQA
#2
Average Accuracy: 65.4
video-question-answering-on-tvqa
LLaMA-VQA
#1
Accuracy: 82.2
Rank counts only results with a code link.