All in One: Exploring Unified Video-Language Pre-training

Benchmark Model Rank Results
video-question-answering-on-situatedAll-in-one#10Average Accuracy: 47.5
video-retrieval-on-msr-vtt-1kaAll-in-one-B#35text-to-video R@1: 37.9text-to-video R@5: 68.1
visual-question-answering-on-msrvtt-qa-1All-in-one-B#12Accuracy: 0.443
visual-question-answering-on-msvd-qa-1All-in-one-B#18Accuracy: 0.483