CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion

Benchmark Model Rank Results
question-answering-on-sqa3dCREMA#1AnswerExactMatch (Question Answering): 54.6
video-question-answering-on-next-qaCREMA#25Accuracy: 73.9