| image-captioning-on-coco-captions | VinVL | #14 | BLEU-4: 41.0CIDER: 140.9METEOR: 31.1SPICE: 25.2 |
| image-captioning-on-nocaps-entire | VinVL (Microsoft Cognitive Services + MSR) | #4 | CIDEr: 92.46B1: 81.59B2: 65.15B3: 45.04B4: 26.15… |
| image-captioning-on-nocaps-in-domain | VinVL (Microsoft Cognitive Services + MSR) | #7 | CIDEr: 97.99B1: 83.24B2: 68.04B3: 49.68B4: 30.62… |
| image-captioning-on-nocaps-near-domain | VinVL (Microsoft Cognitive Services + MSR) | #5 | CIDEr: 95.16B1: 82.77B2: 66.94B3: 47.02B4: 27.97… |
| image-captioning-on-nocaps-out-of-domain | VinVL (Microsoft Cognitive Services + MSR) | #5 | CIDEr: 78.01B1: 75.78B2: 56.1B3: 34.02B4: 15.86… |
| image-captioning-on-nocaps-val-in-domain | VinVL | #7 | CIDEr: 103.1SPICE: 14.2Pre-train (#images): 5.7M |
| image-captioning-on-nocaps-val-near-domain | VinVL | #7 | CIDEr: 96.1SPICE: 13.8Pre-train (#images): 5.7M |
| image-captioning-on-nocaps-val-out-domain | VinVL | #8 | CIDEr: 88.3SPICE: 12.1Pretrain (#images): 5.7M |
| image-captioning-on-nocaps-val-overall | VinVL | #7 | CIDEr: 95.5SPICE: 13.5Pretrain (#images): 5.7M |
| image-text-matching-on-commercialadsdataset | VinVL | #2 | ADD(S) AUC: 88.56 |
| visual-question-answering-on-gqa-test2019 | Single Model | #2 | Accuracy: 64.65Binary: 82.63Open: 48.77Consistency: 94.35… |
| visual-question-answering-on-vqa-v2-test-std | MSR + MS Cog. Svcs., X10 models | #11 | overall: 77.45yes/no: 92.38number: 62.55other: 67.87 |
| visual-question-answering-on-vqa-v2-test-std | MSR + MS Cog. Svcs. | #12 | overall: 76.63yes/no: 92.04number: 61.5other: 66.68 |