CLIP-ViP: Adapting Pre-trained Image-Text Model to Video-Language Representation Alignment

Benchmark Model Rank Results
video-retrieval-on-activitynetCLIP-ViP#9text-to-video R@1: 61.4text-to-video R@5: 85.7
video-retrieval-on-didemoCLIP-ViP#13text-to-video R@1: 55.3text-to-video R@5: 82text-to-video R@10: 89.3
video-retrieval-on-lsmdcCLIP-ViP#8text-to-video R@1: 30.7text-to-video R@5: 51.4
video-retrieval-on-msr-vtt-1kaCLIP-ViP#1text-to-video R@1: 57.7text-to-video R@5: 80.5