X-CLIP: End-to-End Multi-grained Contrastive Learning for Video-Text Retrieval

Benchmark Model Rank Results
video-retrieval-on-activitynetX-CLIP#19text-to-video R@1: 46.2text-to-video R@5: 75.5
video-retrieval-on-didemoX-CLIP#23text-to-video R@1: 47.8text-to-video R@5: 79.3
video-retrieval-on-lsmdcX-CLIP#10text-to-video R@1: 26.1video-to-text R@1: 26.9
video-retrieval-on-msr-vtt-1kaX-CLIP#15text-to-video R@1: 49.3text-to-video R@5: 75.8
video-retrieval-on-msvdX-CLIP#8text-to-video R@1: 50.4text-to-video R@5: 80.6