TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models

Benchmark Model Rank Results
video-based-generative-performanceTS-LLaVA-34B#3mean: 3.38
video-based-generative-performance-1TS-LLaVA-34B#3gpt-score: 3.55
video-based-generative-performance-2TS-LLaVA-34B#2gpt-score: 3.69
video-based-generative-performance-3TS-LLaVA-34B#3gpt-score: 3.86
video-based-generative-performance-4TS-LLaVA-34B#6gpt-score: 3.03
video-based-generative-performance-5TS-LLaVA-34B#5gpt-score: 2.77
zero-shot-video-question-answer-on-egoschemaTS-LLaVA-34B#9Accuracy: 57.8
zero-shot-video-question-answer-on-intentqaTS-LLaVA-34B#2Accuracy: 67.9
zero-shot-video-question-answer-on-next-qaTS-LLaVA-34B#4Accuracy: 73.6
zeroshot-video-question-answer-on-activitynetTS-LLaVA-34B#6Accuracy: 58.9Confidence Score: 3.5
zeroshot-video-question-answer-on-msrvtt-qaTS-LLaVA-34B#6Accuracy: 66.2Confidence Score: 3.6
zeroshot-video-question-answer-on-msvd-qaTS-LLaVA-34B#8Accuracy: 79.4Confidence Score: 4.1
zeroshot-video-question-answer-on-tgif-qaTS-LLaVA-34B#3Accuracy: 81.0Confidence Score: 4.2