Expectation-Maximization Contrastive Learning for Compact Video-and-Language Representations

Benchmark Model Rank Results
video-captioning-on-msr-vtt-1EMCL-Net#15CIDEr: 54.6METEOR: 30.2ROUGE-L: 63.2BLEU-4: 45.3
video-question-answering-on-msrvtt-qaEMCL-Net#8Accuracy: 45.8
video-retrieval-on-activitynetEMCL-Net++#15text-to-video R@1: 50.6text-to-video R@5: 78.7
video-retrieval-on-activitynetEMCL-Net#22text-to-video R@1: 41.2text-to-video R@5: 72.7
video-retrieval-on-lsmdcEMCL-Net++#12text-to-video R@1: 25.9text-to-video R@5: 46.4video-to-text R@1: 26.7
video-retrieval-on-lsmdcEMCL-Net#18text-to-video R@1: 23.9text-to-video R@5: 42.4
video-retrieval-on-lsmdcEMCL-Net (Ours)++ LSMDC Rohrbach et al. (2015)#33text-to-video R@10: 53.7text-to-video Mean Rank: 8
video-retrieval-on-msr-vtt-1kaEMCL-Net++#10text-to-video R@1: 51.6text-to-video R@5: 78.1
video-retrieval-on-msr-vtt-1kaEMCL-Net#26text-to-video R@1: 46.8text-to-video R@5: 73.1
visual-question-answering-on-msrvtt-qa-1EMCL-Net#9Accuracy: 0.458