Learning Joint Embedding with Multimodal Cues for Cross-Modal Video-Text Retrieval
Open paper
Benchmark
Model
Rank
Results
video-retrieval-on-msr-vtt
JEMC
#29
text-to-video R@1: 7.0
text-to-video R@5: 20.9
text-to-video R@10: 29.7
…
Rank counts only results with a code link.