LXMERT: Learning Cross-Modality Encoder Representations from Transformers

Benchmark Model Rank Results
visual-question-answering-on-a-okvqaLXMERT#6MC Accuracy: 41.6DA VQA Score: 25.9
visual-question-answering-on-gqa-test-devLXMERT (Pre-train + scratch)#5Accuracy: 60.0
visual-question-answering-on-gqa-test-stdLXMERT#4Accuracy: 60.3
visual-question-answering-on-gqa-test2019LXR955, Ensemble#3Accuracy: 62.71Binary: 79.79Open: 47.64Consistency: 93.1
visual-question-answering-on-gqa-test2019LXR955, Single Model#4Accuracy: 60.33Binary: 77.16Open: 45.47Consistency: 89.59
visual-question-answering-on-vqa-v2-test-devLXMERT (Pre-train + scratch)#29Accuracy: 69.9
visual-question-answering-on-vqa-v2-test-stdLXMERT#18overall: 72.5
visual-reasoning-on-nlvr2-devLXMERT (Pre-train + scratch)#14Accuracy: 74.9
visual-reasoning-on-nlvr2-testLXMERT#13Accuracy: 76.2