Video Question Answering with Iterative Video-Text Co-Tokenization

Benchmark Model Rank Results
video-question-answering-on-ivqaCo-TokenizationAccuracy: 38.2
visual-question-answering-on-msrvtt-qa-1Co-TokenizationAccuracy: .457
visual-question-answering-on-msvd-qa-1Co-TokenizationAccuracy: .486