| image-captioning-on-nocaps-val-in-domain | BLIP_ViT-L | #4 | CIDEr: 114.9SPICE: 15.2Pre-train (#images): 129M |
| image-captioning-on-nocaps-val-in-domain | BLIP_CapFilt-L | #6 | CIDEr: 111.8SPICE: 14.9Pre-train (#images): 129M |
| image-captioning-on-nocaps-val-near-domain | BLIP_ViT-L | #4 | CIDEr: 112.1SPICE: 14.9Pre-train (#images): 129M |
| image-captioning-on-nocaps-val-near-domain | BLIP_CapFilt-L | #6 | CIDEr: 108.6SPICE: 14.8Pre-train (#images): 129M |
| image-captioning-on-nocaps-val-out-domain | BLIP_ViT-L | #4 | CIDEr: 115.3SPICE: 14.4Pretrain (#images): 129M |
| image-captioning-on-nocaps-val-out-domain | BLIP_CapFilt-L | #6 | CIDEr: 111.5SPICE: 14.2Pretrain (#images): 129M |
| image-captioning-on-nocaps-val-overall | BLIP_ViT-L | #4 | CIDEr: 113.2SPICE: 14.8Pretrain (#images): 129M |
| image-captioning-on-nocaps-val-overall | BLIP_CapFilt-L | #6 | CIDEr: 109.6SPICE: 14.7Pretrain (#images): 129M |
| image-text-matching-on-commercialadsdataset | BLIP | #5 | ADD(S) AUC: 83.51 |
| open-vocabulary-attribute-detection-on-ovad-1 | BLIP | #3 | mean average precision: 24.3 |
| visual-reasoning-on-nlvr2-test | BLIP-129M | #9 | Accuracy: 83.09 |