Toward Building General Foundation Models for Language, Vision, and Vision-Language Understanding Tasks

Benchmark Model Rank Results
cross-modal-retrieval-on-coco-2014XFM (base)#4Text-to-image R@1: 67.0Text-to-image R@5: 87.2
visual-grounding-on-refcoco-test-bXFM (base)#4Accuracy (%): 79.8
visual-grounding-on-refcoco-testaXFM (base)#4Accuracy (%): 90.4
visual-grounding-on-refcoco-valXFM (base)#4Accuracy (%): 86.1
visual-question-answering-on-vqa-v2-test-devXFM (base)#10Accuracy: 80.4
visual-reasoning-on-nlvr2-devXFM (base)#3Accuracy: 87.6
visual-reasoning-on-nlvr2-testXFM (base)#3Accuracy: 88.4