Heterogeneous Memory Enhanced Multimodal Attention Model for Video Question Answering

Benchmark Model Rank Results
visual-question-answering-on-msrvtt-qa-1HMEMA#24Accuracy: 0.33
visual-question-answering-on-msvd-qa-1HMEMA#28Accuracy: 0.337