CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios

Benchmark Model Rank Results
video-based-generative-performanceCAT-7B#11mean: 3.07Correctness of Information: 3.08Detail Orientation: 2.95
zeroshot-video-question-answer-on-activitynetCAT-7B#12Accuracy: 50.2Confidence Score: 3.5
zeroshot-video-question-answer-on-msrvtt-qaCAT-7B#11Accuracy: 62.1Confidence Score: 3.5