Towards Fast Adaptation of Pretrained Contrastive Models for Multi-channel Video-Language Retrieval

Benchmark Model Rank Results
video-question-answering-on-activitynet-qaText + Text (no Multimodal Pretext Training)#19Accuracy: 41.4
video-question-answering-on-how2qaText + Text (no Multimodal Pretext Training)#1Accuracy: 93.2
video-question-answering-on-ivqaText + Text (no Multimodal Pretext Training)#1Accuracy: 40.2