Lightweight Recurrent Cross-modal Encoder for Video Question Answering

Benchmark Model Rank Results
visual-question-answering-on-msrvtt-qa-1LRCE#18Accuracy: 0.42
visual-question-answering-on-msvd-qa-1LRCE#19Accuracy: 0.478