Learning Joint Embedding with Multimodal Cues for Cross-Modal Video-Text Retrieval

Benchmark Model Rank Results
video-retrieval-on-msr-vttJEMC#29text-to-video R@1: 7.0text-to-video R@5: 20.9text-to-video R@10: 29.7