Understanding Long Videos with Multimodal Language Models

Benchmark Model Rank Results
zero-shot-video-question-answer-on-egoschemaMVU (13B)#8Accuracy: 60.3Inference Speed (s): 2.42
zero-shot-video-question-answer-on-egoschema-1MVU (13B)#21Accuracy: 37.6
zero-shot-video-question-answer-on-next-qaMVU (13B)#20Accuracy: 55.2