Improving Video-Text Retrieval by Multi-Stream Corpus Alignment and Dual Softmax Loss

Benchmark Model Rank Results
video-retrieval-on-activitynetCAMoE#14text-to-video R@1: 51.0text-to-video R@5: 77.7
video-retrieval-on-didemoCAMoE#26text-to-video R@1: 43.8text-to-video R@5: 71.4
video-retrieval-on-lsmdcCAMoE#11text-to-video R@1: 25.9text-to-video R@5: 46.1
video-retrieval-on-msr-vttCAMoE#15text-to-video R@1: 32.9text-to-video R@5: 58.3
video-retrieval-on-msr-vtt-1kaCAMoE#18text-to-video R@1: 48.8text-to-video R@5: 75.6
video-retrieval-on-msvdCAMoE#5text-to-video R@1: 51.8text-to-video R@5: 87.6