Vista-LLaMA: Reliable Video Narrator via Equal Distance to Visual Tokens

Benchmark Model Rank Results
question-answering-on-next-qa-open-endedVista-LLaMAAccuracy: 60.7Confidence Score: 3.4
zeroshot-video-question-answer-on-msrvtt-qaVista-LLaMA-7BAccuracy: 60.5Confidence Score: 3.3