VL-BERT: Pre-training of Generic Visual-Linguistic Representations

Benchmark Model Rank Results
image-text-matching-on-commercialadsdatasetVL-BERT#4ADD(S) AUC: 86.27
visual-question-answering-on-vcr-q-a-testVL-BERTLARGE#4Accuracy: 75.8
visual-question-answering-on-vcr-q-ar-testVL-BERTLARGE#3Accuracy: 59.7
visual-question-answering-on-vcr-qa-r-testVL-BERTLARGE#4Accuracy: 78.4
visual-question-answering-on-vqa-v2-test-devVL-BERTLARGE#21Accuracy: 71.79
visual-question-answering-on-vqa-v2-test-devVL-BERTBASE#24Accuracy: 71.16
visual-question-answering-on-vqa-v2-test-stdVL-BERTLARGE#19overall: 72.2