LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models

Benchmark Model Rank Results
video-based-generative-performanceLLaMA-VID-13B (2 Token)#14mean: 2.99Correctness of Information: 3.07Detail Orientation: 3.05
video-based-generative-performanceLLaMA-VID-7B (2 Token)#16mean: 2.89Correctness of Information: 2.96Detail Orientation: 3.00
video-question-answering-on-activitynet-qaLLaMA-VID-13B (2 Token)#7Accuracy: 47.5Confidence score: 3.3
video-question-answering-on-activitynet-qaLLaMA-VID-7B (2 Token)#8Accuracy: 47.4Confidence score: 3.3
video-question-answering-on-ovbenchLLaMA-VID (7B)#8AVG: 41.9
zeroshot-video-question-answer-on-activitynetLLaMA-VID-13B (2 Token)#15Accuracy: 47.5Confidence Score: 3.3
zeroshot-video-question-answer-on-activitynetLLaMA-VID-7B (2 Token)#16Accuracy: 47.4Confidence Score: 3.3
zeroshot-video-question-answer-on-msrvtt-qaLLaMA-VID-13B (2 Token)#17Accuracy: 58.9Confidence Score: 3.3
zeroshot-video-question-answer-on-msrvtt-qaLLaMA-VID-7B (2 Token)#18Accuracy: 57.7Confidence Score: 3.2
zeroshot-video-question-answer-on-msvd-qaLLaMA-VID-13B (2 Token)#19Accuracy: 70.0Confidence Score: 3.7
zeroshot-video-question-answer-on-msvd-qaLLaMA-VID-7B (2 Token)#20Accuracy: 69.7Confidence Score: 3.7