Long-Form Video-Language Pre-Training with Multimodal Temporal Contrastive Learning

Benchmark Model Rank Results
video-retrieval-on-condensed-moviesLF-VILA#3text-to-video R@1: 13.6text-to-video R@5: 32.5
video-retrieval-on-querydLF-VILA#2text-to-video R@1: 69.7text-to-video R@5: 85.7