LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token

Benchmark Model Rank Results
zeroshot-video-question-answer-on-activitynetLLaVA-Mini#8Accuracy: 53.5Confidence Score: 3.5
zeroshot-video-question-answer-on-msrvtt-qaLLaVA-Mini#14Accuracy: 59.5Confidence Score: 3.6
zeroshot-video-question-answer-on-msvd-qaLLaVA-Mini#16Accuracy: 70.9Confidence Score: 4.0