SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models

Benchmark Model Rank Results
video-based-generative-performanceSlowFast-LLaVA-34B#5mean: 3.32
video-based-generative-performance-1SlowFast-LLaVA-34B#4gpt-score: 3.48
video-based-generative-performance-2SlowFast-LLaVA-34B#3gpt-score: 3.57
video-based-generative-performance-3SlowFast-LLaVA-34B#4gpt-score: 3.84
video-based-generative-performance-4SlowFast-LLaVA-34B#8gpt-score: 2.96
video-based-generative-performance-5SlowFast-LLaVA-34B#4gpt-score: 2.77
zero-shot-video-question-answer-on-egoschemaSlowFast-LLaVA-34B#12Accuracy: 47.2
zero-shot-video-question-answer-on-intentqaSlowFast-LLaVA-34B#8Accuracy: 60.1
zero-shot-video-question-answer-on-next-qaSlowFast-LLaVA-34B#15Accuracy: 64.2
zeroshot-video-question-answer-on-activitynetSlowFast-LLaVA-34B#5Accuracy: 59.2Confidence Score: 3.5
zeroshot-video-question-answer-on-msrvtt-qaSlowFast-LLaVA-34B#4Accuracy: 67.4Confidence Score: 3.7
zeroshot-video-question-answer-on-msvd-qaSlowFast-LLaVA-34B#6Accuracy: 79.9Confidence Score: 4.1
zeroshot-video-question-answer-on-tgif-qaSlowFast-LLaVA-34B#5Accuracy: 80.6Confidence Score: 4.3