Video Question Answering with Iterative Video-Text Co-Tokenization
Open paper
Benchmark
Model
Rank
Results
video-question-answering-on-ivqa
Co-Tokenization
–
Accuracy: 38.2
visual-question-answering-on-msrvtt-qa-1
Co-Tokenization
–
Accuracy: .457
visual-question-answering-on-msvd-qa-1
Co-Tokenization
–
Accuracy: .486
Rank counts only results with a code link.