COTS: Collaborative Two-Stream Vision-Language Pre-Training Model for Cross-Modal Retrieval

Benchmark Model Rank Results
video-retrieval-on-msr-vttCOTStext-to-video R@1: 32.1text-to-video R@5: 60.8
video-retrieval-on-msr-vtt-1kaCOTStext-to-video R@1: 36.8text-to-video R@5: 63.8