UNITER: UNiversal Image-TExt Representation Learning

Benchmark Model Rank Results
visual-entailment-on-snli-ve-testUNITER (Large)#6Accuracy: 78.98
visual-entailment-on-snli-ve-valUNITER#8Accuracy: 78.98
visual-question-answering-on-vcr-q-a-testUNITER-large (10 ensemble)#2Accuracy: 79.8
visual-question-answering-on-vcr-q-a-testUNITER (Large)#3Accuracy: 77.3
visual-question-answering-on-vcr-q-ar-testUNITER (Large)#2Accuracy: 62.8
visual-question-answering-on-vcr-qa-r-testUNITER-large (ensemble of 10 models)#2Accuracy: 83.4
visual-question-answering-on-vcr-qa-r-testUNITER (Large)#3Accuracy: 80.8
visual-question-answering-on-vqa-v2-test-devUNITER (Large)#18Accuracy: 73.24
visual-question-answering-on-vqa-v2-test-stdUNITER (Large)#16overall: 73.4
visual-reasoning-on-nlvr2-testUNITER (Large)#11Accuracy: 79.5
zero-shot-cross-modal-retrieval-on-flickr30kUNITER#18Image-to-text R@1: 80.7Image-to-text R@5: 95.7