Less is More: ClipBERT for Video-and-Language Learning via Sparse Sampling
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-msrvtt-qa
CLIPBERT
#21
Accuracy: 0.374
Rank counts only results with a code link.