| cross-modal-retrieval-on-coco-2014 | ViLT-B/32 | #24 | Text-to-image R@1: 42.7Text-to-image R@5: 72.9… |
| cross-modal-retrieval-on-flickr30k | ViLT-B/32 | #10 | Image-to-text R@1: 83.5Image-to-text R@5: 96.7… |
| image-retrieval-on-photochat | ViLT | #2 | R1: 11.5R@10: 25.6R@5: 33.8Sum(R@1,5,10): 71.0 |
| multimodal-intent-recognition-on-mmdialog | ViLT | #4 | F1: 55.8 |
| multimodal-intent-recognition-on-photochat | ViLT | #5 | F1: 52.4Precision: 55.4Recall: 58.9 |
| visual-question-answering-on-vqa-v2-test-dev | ViLT-B/32 | #22 | Accuracy: 71.26 |
| visual-reasoning-on-nlvr2-dev | ViLT-B/32 | #13 | Accuracy: 75.7 |
| visual-reasoning-on-nlvr2-test | ViLT-B/32 | #14 | Accuracy: 76.13 |
| zero-shot-cross-modal-retrieval-on-coco-2014 | ViLT-B/32 | #16 | Image-to-text R@1: 56.5Image-to-text R@5: 82.6… |
| zero-shot-cross-modal-retrieval-on-flickr30k | ViLT-B/32 | #19 | Image-to-text R@1: 73.2Image-to-text R@5: 93.6… |