Heterogeneous Memory Enhanced Multimodal Attention Model for Video Question Answering
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-msrvtt-qa-1
HMEMA
#24
Accuracy: 0.33
visual-question-answering-on-msvd-qa-1
HMEMA
#28
Accuracy: 0.337
Rank counts only results with a code link.