COLT: Enhancing Video Large Language Models with Continual Tool Usage

Benchmark Model Rank Results
video-question-answering-on-activitynet-qaCOLT 10x1–Accuracy: 51.2Confidence score: 3.4
video-question-answering-on-activitynet-qaCOLT 5x2–Accuracy: 52.5Confidence score: 3.5
video-question-answering-on-activitynet-qaCOLT joint–Accuracy: 54.7Confidence score: 3.8
video-question-answering-on-mvbenchCOLT 10x1–Avg.: 50.6
video-question-answering-on-mvbenchCOLT 5x2–Avg.: 51.8
video-question-answering-on-mvbenchCOLT joint–Avg.: 53.4
zeroshot-video-question-answer-on-activitynet-qaCOLT 10x1–Accuracy: 51.2Confidence Score: 3.4
zeroshot-video-question-answer-on-activitynet-qaCOLT 5x2–Accuracy: 52.5Confidence Score: 3.5
zeroshot-video-question-answer-on-activitynet-qaCOLT joint–Accuracy: 54.7Confidence Score: 3.8
zeroshot-video-question-answer-on-msrvtt-qaCOLT 10x1–Accuracy: 63.0Confidence Score: 3.4
zeroshot-video-question-answer-on-msrvtt-qaCOLT 5x2–Accuracy: 63.9Confidence Score: 3.5
zeroshot-video-question-answer-on-msrvtt-qaCOLT joint–Accuracy: 65.1Confidence Score: 3.6
zeroshot-video-question-answer-on-msvd-qaCOLT 10x1–Accuracy: 74.7Confidence Score: 3.9
zeroshot-video-question-answer-on-msvd-qaCOLT 5x2–Accuracy: 75.5Confidence Score: 3.9
zeroshot-video-question-answer-on-msvd-qaCOLT joint–Accuracy: 78.2Confidence Score: 4.2