Long-Form Video-Language Pre-Training with Multimodal Temporal Contrastive Learning
Open paper
Benchmark
Model
Rank
Results
video-retrieval-on-condensed-movies
LF-VILA
#3
text-to-video R@1: 13.6
text-to-video R@5: 32.5
…
video-retrieval-on-queryd
LF-VILA
#2
text-to-video R@1: 69.7
text-to-video R@5: 85.7
…
Rank counts only results with a code link.