ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision

Benchmark Model Rank Results
cross-modal-retrieval-on-coco-2014ViLT-B/32#24Text-to-image R@1: 42.7Text-to-image R@5: 72.9
cross-modal-retrieval-on-flickr30kViLT-B/32#10Image-to-text R@1: 83.5Image-to-text R@5: 96.7
image-retrieval-on-photochatViLT#2R1: 11.5R@10: 25.6R@5: 33.8Sum(R@1,5,10): 71.0
multimodal-intent-recognition-on-mmdialogViLT#4F1: 55.8
multimodal-intent-recognition-on-photochatViLT#5F1: 52.4Precision: 55.4Recall: 58.9
visual-question-answering-on-vqa-v2-test-devViLT-B/32#22Accuracy: 71.26
visual-reasoning-on-nlvr2-devViLT-B/32#13Accuracy: 75.7
visual-reasoning-on-nlvr2-testViLT-B/32#14Accuracy: 76.13
zero-shot-cross-modal-retrieval-on-coco-2014ViLT-B/32#16Image-to-text R@1: 56.5Image-to-text R@5: 82.6
zero-shot-cross-modal-retrieval-on-flickr30kViLT-B/32#19Image-to-text R@1: 73.2Image-to-text R@5: 93.6