Vista-LLaMA: Reliable Video Narrator via Equal Distance to Visual Tokens
Open paper
Benchmark
Model
Rank
Results
question-answering-on-next-qa-open-ended
Vista-LLaMA
–
Accuracy: 60.7
Confidence Score: 3.4
zeroshot-video-question-answer-on-msrvtt-qa
Vista-LLaMA-7B
–
Accuracy: 60.5
Confidence Score: 3.3
Rank counts only results with a code link.