Deep Modular Co-Attention Networks for Visual Question Answering

Benchmark Model Rank Results
question-answering-on-sqa3dMCAN#7AnswerExactMatch (Question Answering): 43.42
visual-question-answering-on-vqa-v2-test-devMCANed-6#26Accuracy: 70.63
visual-question-answering-on-vqa-v2-test-stdMCANed-6#22overall: 70.9