Less is More: ClipBERT for Video-and-Language Learning via Sparse Sampling

Benchmark Model Rank Results
visual-question-answering-on-msrvtt-qaCLIPBERT#21Accuracy: 0.374