An Empirical Study of End-to-End Video-Language Transformers with Masked Visual Modeling

Benchmark Model Rank Results
video-captioning-on-msr-vtt-1VIOLETv2#11CIDEr: 58
video-captioning-on-msvd-1VIOLETv2#7CIDEr: 139.2
video-question-answering-on-msrvtt-mcVIOLETv2#1Accuracy: 97.6
video-question-answering-on-msrvtt-qaVIOLETv2#10Accuracy: 44.5
video-retrieval-on-didemoVIOLETv2#22text-to-video R@1: 47.9text-to-video R@5: 76.5
video-retrieval-on-lsmdcVIOLETv2#17text-to-video R@1: 24text-to-video R@5: 43.5text-to-video R@10: 54.1
video-retrieval-on-msr-vttVIOLETv2#12text-to-video R@1: 37.2text-to-video R@5: 64.8
visual-question-answering-on-msvd-qa-1VIOLETv2#12Accuracy: 0.547