Multi-modal Transformer for Video Retrieval

Benchmark Model Rank Results
video-retrieval-on-activitynetMMT-Pretrained#24text-to-video R@1: 28.7text-to-video R@5: 61.4
video-retrieval-on-activitynetMMT#27text-to-video R@1: 22.7text-to-video R@5: 54.2
video-retrieval-on-lsmdcMMT-Pretrained#25text-to-video R@1: 13.5text-to-video R@5: 29.9
video-retrieval-on-lsmdcMMT#26text-to-video R@1: 13.2text-to-video R@5: 29.2
video-retrieval-on-msr-vtt-1kaMMT-Pretrained#44text-to-video R@1: 26.6text-to-video R@5: 57.1
video-retrieval-on-msr-vtt-1kaMMT#46text-to-video R@1: 24.6text-to-video R@5: 54.0
zero-shot-video-retrieval-on-msr-vttMMT#34text-to-video R@5: 14.4text-to-video Median Rank: 66