An Image Grid Can Be Worth a Video: Zero-shot Video Question Answering Using a VLM

Benchmark Model Rank Results
video-based-generative-performanceIG-VLM-GPT4v#8mean: 3.17Correctness of Information: 3.40Detail Orientation: 2.80
zero-shot-video-question-answer-on-intentqaIG-VLM#5Accuracy: 65.3
zero-shot-video-question-answer-on-next-qaIG-VLM(LLaVA v1.6)#8Accuracy: 70.9
zero-shot-video-question-answer-on-next-qaIG-VLM (GPT-4)#10Accuracy: 68.6
zero-shot-video-question-answer-on-tvqaIG-VLM (no speech, GPT-4V)#2Accuracy: 57.8
zeroshot-video-question-answer-on-activitynetIG-VLM#7Accuracy: 58.4Confidence Score: 3.5
zeroshot-video-question-answer-on-msrvtt-qaIG-VLM#9Accuracy: 63.8Confidence Score: 3.5
zeroshot-video-question-answer-on-msvd-qaIG-VLM-34B#7Accuracy: 79.6Confidence Score: 4.1
zeroshot-video-question-answer-on-tgif-qaIG-VLM#6Accuracy: 79.1Confidence Score: 4.2