Zero-Shot Video Question Answering via Frozen Bidirectional Language Models

Benchmark Model Rank Results
video-question-answering-on-activitynet-qaFrozenBiLM#17Accuracy: 43.2
video-question-answering-on-activitynet-qaFrozenBiLM (0-shot)#30Accuracy: 25.9
video-question-answering-on-how2qaFrozenBiLM#2Accuracy: 86.7
video-question-answering-on-how2qaFrozenBiLM (0-shot)#6Accuracy: 58.4
video-question-answering-on-ivqaFrozenBiLM#2Accuracy: 39.6
video-question-answering-on-ivqaFrozenBiLM (0-shot)#4Accuracy: 26.8
video-question-answering-on-msrvtt-qaFrozenBiLM#6Accuracy: 47.0
video-question-answering-on-msrvtt-qaFrozenBiLM (0-shot)#13Accuracy: 16.7
video-question-answering-on-tvqaFrozenBiLM#2Accuracy: 82
visual-question-answering-on-msrvtt-qa-2FrozenBiLM#1Accuracy: 0.470
zero-shot-video-question-answer-on-egoschema-1FrozenBiLM#27Accuracy: 26.9
zero-shot-video-question-answer-on-tvqaFrozenBiLM (with speech)#1Accuracy: 59.7
zero-shot-video-question-answer-on-tvqaFrozenBILM (no speech)#9Accuracy: 29.7
zeroshot-video-question-answer-on-activitynetFrozenBiLM#27Accuracy: 24.7
zeroshot-video-question-answer-on-msvd-qaFrozenBiLM#28Accuracy: 33.8
zeroshot-video-question-answer-on-tgif-qaFrozenBiLM#13Accuracy: 41.9