VisualBERT: A Simple and Performant Baseline for Vision and Language

Benchmark Model Rank Results
phrase-grounding-on-flickr30k-entities-devVisualBERT#3R@1: 70.4R@10: 86.31R@5: 84.49
phrase-grounding-on-flickr30k-entities-testVisualBERT#9R@1: 71.33R@5: 84.98R@10: 86.51
visual-question-answering-on-vcr-q-a-testVisualBERT#6Accuracy: 71.6
visual-question-answering-on-vcr-q-ar-testVisualBERT#5Accuracy: 52.4
visual-question-answering-on-vcr-qa-r-testVisualBERT#6Accuracy: 73.2
visual-question-answering-on-vqa-v2-test-devVisualBERT#25Accuracy: 70.8
visual-question-answering-on-vqa-v2-test-stdVisualBERT#21overall: 71
visual-reasoning-on-nlvr2-devVisualBERT#15Accuracy: 66.7