| Benchmark | Model | Rank | Results |
|---|---|---|---|
| cross-modal-retrieval-on-coco-2014 | VK-OOD | #10 | Text-to-image R@1: 62.9Text-to-image R@5: 84.8… |
| visual-question-answering-on-ok-vqa | VK-OOD | #13 | Accuracy: 52.4 |
| visual-question-answering-on-vqa-v2-test-dev | VK-OOD | #15 | Accuracy: 77.9 |
| visual-reasoning-on-nlvr2-dev | VK-OOD | #7 | Accuracy: 84.6 |
| zero-shot-cross-modal-retrieval-on-flickr30k | VK-OOD | #13 | Image-to-text R@1: 89.0Image-to-text R@5: 99.2… |