| Benchmark | Model | Rank | Results |
|---|---|---|---|
| cross-modal-retrieval-on-coco-2014 | XFM (base) | #4 | Text-to-image R@1: 67.0Text-to-image R@5: 87.2… |
| visual-grounding-on-refcoco-test-b | XFM (base) | #4 | Accuracy (%): 79.8 |
| visual-grounding-on-refcoco-testa | XFM (base) | #4 | Accuracy (%): 90.4 |
| visual-grounding-on-refcoco-val | XFM (base) | #4 | Accuracy (%): 86.1 |
| visual-question-answering-on-vqa-v2-test-dev | XFM (base) | #10 | Accuracy: 80.4 |
| visual-reasoning-on-nlvr2-dev | XFM (base) | #3 | Accuracy: 87.6 |
| visual-reasoning-on-nlvr2-test | XFM (base) | #3 | Accuracy: 88.4 |