| cross-modal-retrieval-on-coco-2014 | ALBEF | #13 | Text-to-image R@1: 60.7Text-to-image R@5: 84.3… |
| image-text-matching-on-commercialadsdataset | ALBEF | #6 | ADD(S) AUC: 82.74 |
| image-to-text-retrieval-on-flickr30k | ALBEF | #7 | Recall@1: 95.9Recall@5: 99.8Recall@10: 100.0 |
| open-vocabulary-attribute-detection-on-ovad-1 | ALBEF | #5 | mean average precision: 21.0 |
| visual-question-answering-on-vqa-v2-test-dev | ALBEF (14M) | #16 | Accuracy: 75.84 |
| visual-question-answering-on-vqa-v2-test-std | ALBEF (14M) | #13 | overall: 76.04 |
| visual-reasoning-on-nlvr2-dev | ALBEF (14M) | #11 | Accuracy: 83.14 |
| visual-reasoning-on-nlvr2-test | ALBEF (14M) | #10 | Accuracy: 82.55 |
| zero-shot-cross-modal-retrieval-on-coco-2014 | ALBEF | #7 | Image-to-text R@1: 68.7Image-to-text R@5: 89.5… |
| zero-shot-cross-modal-retrieval-on-flickr30k | ALBEF | #10 | Image-to-text R@1: 90.5Image-to-text R@5: 98.8… |