Video-LLaVA: Learning United Visual Representation by Alignment Before Projection

Benchmark Model Rank Results
temporal-relation-extraction-on-vinogroundVideo-LLaVA-7B#11Text Score: 24.8Video Score: 25.8Group Score: 6.6
video-question-answering-on-activitynet-qaVideo-LLaVA#12Accuracy: 45.3Confidence score: 3.3
visual-question-answering-on-mm-vetVideo-LLaVA#133GPT-4 score: 32.0
zeroshot-video-question-answer-on-activitynetVideo-LLaVA#22Accuracy: 45.3Confidence Score: 3.3
zeroshot-video-question-answer-on-msrvtt-qaVideo-LLaVA-7B#16Accuracy: 59.2Confidence Score: 3.5
zeroshot-video-question-answer-on-msvd-qaVideo-LLaVA-7B#17Accuracy: 70.7Confidence Score: 3.9
zeroshot-video-question-answer-on-tgif-qaVideo-LLaVA-7B#9Accuracy: 70.0Confidence Score: 4.0