| cross-modal-retrieval-on-coco-2014 | BEiT-3 | #3 | Text-to-image R@1: 67.2Text-to-image R@5: 92.8… |
| cross-modal-retrieval-on-flickr30k | BEiT-3 | #3 | Image-to-text R@1: 98.0Image-to-text R@5: 100.0… |
| instance-segmentation-on-coco | BEiT-3 | #5 | mask AP: 54.8 |
| object-detection-on-coco | BEiT-3 | #13 | box mAP: 63.7 |
| semantic-segmentation-on-ade20k | BEiT-3 | #5 | Validation mIoU: 62.8Params (M): 1900 |
| semantic-segmentation-on-ade20k-val | BEiT-3 | #1 | mIoU: 62.8 |
| visual-question-answering-on-vqa-v2-test-dev | BEiT-3 | #2 | Accuracy: 84.19 |
| visual-question-answering-on-vqa-v2-test-std | BEiT-3 | #1 | overall: 84.03 |
| visual-reasoning-on-nlvr2-dev | BEiT-3 | #1 | Accuracy: 91.51 |
| visual-reasoning-on-nlvr2-test | BEiT-3 | #1 | Accuracy: 92.58 |
| zero-shot-cross-modal-retrieval-on-flickr30k | BEiT-3 | #2 | Image-to-text R@1: 94.9Image-to-text R@5: 99.9… |