HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips

Benchmark Model Rank Results
long-video-retrieval-background-removed-onText-Video Embedding#5Cap. Avg. R@1: 46.6Cap. Avg. R@5: 74.3Cap. Avg. R@10: 83.7
temporal-action-localization-on-crosstaskText-Video Embedding#3Recall: 33.6
video-retrieval-on-lsmdcText-Video Embedding#32text-to-video R@1: 7.2text-to-video R@5: 19.6text-to-video R@10: 27.9
video-retrieval-on-msr-vttText-Video Embedding#25text-to-video R@1: 14.9text-to-video R@10: 52.8
video-retrieval-on-msr-vtt-1kaHT-Pretrained#48text-to-video R@1: 14.9text-to-video R@5: 40.2
video-retrieval-on-msr-vtt-1kaHT#49text-to-video R@1: 12.1text-to-video R@5: 35.0
video-retrieval-on-youcook2Text-Video Embedding#8text-to-video R@1: 8.2text-to-video R@5: 24.5text-to-video R@10: 35.3