MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling

Benchmark Model Rank Results
video-retrieval-on-didemoMuLTItext-to-video R@1: 56.5text-to-video R@5: 80.2
video-retrieval-on-msr-vtt-1kaMuLTItext-to-video R@1: 54.7text-to-video R@5: 77.7
visual-question-answering-on-msrvtt-qa-1MuLTIAccuracy: 0.478
visual-question-answering-on-msvd-qa-1MuLTIAccuracy: 0.547