| cross-modal-retrieval-on-coco-2014 | X2-VLM (large) | #2 | Text-to-image R@1: 67.7Text-to-image R@5: 87.5… |
| cross-modal-retrieval-on-coco-2014 | X2-VLM (base) | #5 | Text-to-image R@1: 66.2Text-to-image R@5: 87.1… |
| cross-modal-retrieval-on-flickr30k | X2-VLM (large) | #1 | Image-to-text R@1: 98.8Image-to-text R@5: 100Image-to-text R@10: 100… |
| cross-modal-retrieval-on-flickr30k | X2-VLM (base) | #2 | Image-to-text R@1: 98.5Image-to-text R@5: 100Image-to-text R@10: 100… |
| video-retrieval-on-msr-vtt-1ka | X2-VLM (large) | #13 | text-to-video R@1: 49.6text-to-video R@5: 76.7… |
| video-retrieval-on-msr-vtt-1ka | X2-VLM (base) | #23 | text-to-video R@1: 47.6text-to-video R@5: 74.1… |
| visual-grounding-on-refcoco-test-b | X2-VLM (large) | #3 | Accuracy (%): 81.8 |
| visual-grounding-on-refcoco-test-b | X2-VLM (base) | #5 | Accuracy (%): 78.4 |
| visual-grounding-on-refcoco-testa | X2-VLM (large) | #3 | Accuracy (%): 92.1 |
| visual-grounding-on-refcoco-testa | X2-VLM (base) | #5 | Accuracy (%): 90.3 |
| visual-grounding-on-refcoco-val | X2-VLM (large) | #3 | Accuracy (%): 87.6 |
| visual-grounding-on-refcoco-val | X2-VLM (base) | #5 | Accuracy (%): 85.2 |
| visual-question-answering-on-msrvtt-qa-1 | X2-VLM (large) | #10 | Accuracy: 0.455 |
| visual-question-answering-on-msrvtt-qa-1 | X2-VLM (base) | #11 | Accuracy: 0.45 |
| visual-question-answering-on-msvd-qa-1 | X2-VLM (large) | #13 | Accuracy: 0.546 |
| visual-question-answering-on-msvd-qa-1 | X2-VLM (base) | #14 | Accuracy: 0.528 |
| visual-question-answering-on-vqa-v2-test-dev | X2-VLM (large) | #7 | Accuracy: 81.9 |
| visual-question-answering-on-vqa-v2-test-dev | X2-VLM (base) | #9 | Accuracy: 80.4 |
| visual-question-answering-on-vqa-v2-test-std | X2-VLM (large) | #4 | overall: 81.8 |
| visual-question-answering-on-vqa-v2-test-std | X2-VLM (base) | #7 | overall: 80.2 |
| visual-reasoning-on-nlvr2-dev | X2-VLM (large) | #2 | Accuracy: 88.7 |
| visual-reasoning-on-nlvr2-dev | X2-VLM (base) | #4 | Accuracy: 86.2 |
| visual-reasoning-on-nlvr2-test | X2-VLM (large) | #2 | Accuracy: 89.4 |
| visual-reasoning-on-nlvr2-test | X2-VLM (base) | #5 | Accuracy: 87.0 |