Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding

Benchmark Model Rank Results
phrase-grounding-on-flickr30k-entities-testMCB#11R@1: 48.69
visual-question-answering-on-coco-visual-1MCB 7 att.#1Percentage correct: 70.1
visual-question-answering-on-coco-visual-4MCB 7 att.#1Percentage correct: 66.5
visual-question-answering-on-visual7wMCB+Att.#4Percentage correct: 62.2
visual-question-answering-on-vqa-v2-test-devMCB#42Accuracy: 64.7