ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks

Benchmark Model Rank Results
visual-question-answering-on-a-okvqaViLBERT - VQA#5MC Accuracy: 42.1DA VQA Score: 12.0
visual-question-answering-on-a-okvqaViLBERT#7MC Accuracy: 41.5DA VQA Score: 25.9
visual-question-answering-on-a-okvqaViLBERT - OK-VQA#9MC Accuracy: 34.1DA VQA Score: 9.2
visual-question-answering-on-vqa-v2-test-devViLBERT#27Accuracy: 70.55