Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts

Benchmark Model Rank Results
cross-modal-retrieval-on-coco-2014X-VLM (base)#8Text-to-image R@1: 63.4Text-to-image R@5: 85.8
cross-modal-retrieval-on-flickr30kX-VLM (base)#5Image-to-text R@1: 97.1Image-to-text R@5: 100.0
image-captioning-on-coco-captionsX-VLM (base)#12BLEU-4: 41.3CIDER: 140.8
image-retrieval-on-flickr30k-1k-testX-VLM (base)#1R@1: 86.9R@5: 97.3R@10: 98.7
open-vocabulary-attribute-detection-on-ovad-1X-VLM#1mean average precision: 28.0
visual-grounding-on-refcoco-test-bX-VLM (base)#6Accuracy (%): 76.91
visual-grounding-on-refcoco-testaX-VLM (base)#6Accuracy (%): 89.00
visual-grounding-on-refcoco-valX-VLM (base)#6Accuracy (%): 84.51
visual-question-answering-on-vqa-v2-test-devX-VLM (base)#14Accuracy: 78.22
visual-reasoning-on-nlvr2-devX-VLM (base)#9Accuracy: 84.41
visual-reasoning-on-nlvr2-testX-VLM (base)#8Accuracy: 84.76