Open-vocabulary Video Question Answering: A New Benchmark for Evaluating the Generalizability of Video Question Answering Models

Benchmark Model Rank Results
video-question-answering-on-activitynet-qaFrozenBiLM+#14Accuracy: 44.8
video-question-answering-on-activitynet-qaAll-in-one+#20Accuracy: 40.0
video-question-answering-on-activitynet-qaVIOLET+#21Accuracy: 39.7
visual-question-answering-on-msrvtt-qa-1FrozenBiLM+#6Accuracy: 0.470
visual-question-answering-on-msrvtt-qa-1JustAsk+#19Accuracy: 0.418
visual-question-answering-on-msrvtt-qa-1All-in-one+#20Accuracy: 0.395
visual-question-answering-on-msvd-qa-1FrozenBiLM+#8Accuracy: 0.558
visual-question-answering-on-msvd-qa-1VIOLET+#17Accuracy: 0.495
visual-question-answering-on-msvd-qa-1JustAsk+#20Accuracy: 0.477
visual-question-answering-on-msvd-qa-1All-in-one+#24Accuracy: 0.438