BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation

Benchmark Model Rank Results
image-captioning-on-nocaps-val-in-domainBLIP_ViT-L#4CIDEr: 114.9SPICE: 15.2Pre-train (#images): 129M
image-captioning-on-nocaps-val-in-domainBLIP_CapFilt-L#6CIDEr: 111.8SPICE: 14.9Pre-train (#images): 129M
image-captioning-on-nocaps-val-near-domainBLIP_ViT-L#4CIDEr: 112.1SPICE: 14.9Pre-train (#images): 129M
image-captioning-on-nocaps-val-near-domainBLIP_CapFilt-L#6CIDEr: 108.6SPICE: 14.8Pre-train (#images): 129M
image-captioning-on-nocaps-val-out-domainBLIP_ViT-L#4CIDEr: 115.3SPICE: 14.4Pretrain (#images): 129M
image-captioning-on-nocaps-val-out-domainBLIP_CapFilt-L#6CIDEr: 111.5SPICE: 14.2Pretrain (#images): 129M
image-captioning-on-nocaps-val-overallBLIP_ViT-L#4CIDEr: 113.2SPICE: 14.8Pretrain (#images): 129M
image-captioning-on-nocaps-val-overallBLIP_CapFilt-L#6CIDEr: 109.6SPICE: 14.7Pretrain (#images): 129M
image-text-matching-on-commercialadsdatasetBLIP#5ADD(S) AUC: 83.51
open-vocabulary-attribute-detection-on-ovad-1BLIP#3mean average precision: 24.3
visual-reasoning-on-nlvr2-testBLIP-129M#9Accuracy: 83.09