VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding

Benchmark Model Rank Results
action-segmentation-on-coinVideoClip#4Frame accuracy: 68.7
long-video-retrieval-background-removed-onVideoCLIP#2Cap. Avg. R@1: 74.5Cap. Avg. R@5: 94.5Cap. Avg. R@10: 97.9
temporal-action-localization-on-crosstaskVideoCLIP#1Recall: 47.3
temporal-relation-extraction-on-vinogroundVideoCLIP#14Text Score: 17Video Score: 2.8Group Score: 1.2
video-retrieval-on-msr-vtt-1kaVideoCLIP#42text-to-video R@1: 30.9text-to-video R@5: 55.4
video-retrieval-on-youcook2VideoCLIP#3text-to-video R@1: 32.2text-to-video R@5: 62.6
video-retrieval-on-youcook2VideoCLIP (zero-shot)#6text-to-video R@1: 22.7text-to-video R@5: 50.4
zero-shot-video-retrieval-on-didemoVideoCLIP#22text-to-video R@1: 16.6text-to-video R@5: 46.9
zero-shot-video-retrieval-on-msr-vttVideoCLIP#31text-to-video R@1: 10.4text-to-video R@5: 22.2
zero-shot-video-retrieval-on-youcook2VideoCLIP#2text-to-video R@1: 22.7text-to-video R@5: 50.4