| generative-visual-question-answering-on-pmc | BLIP-2 | #2 | BLEU-1: 7.6 |
| image-captioning-on-coco-captions | BLIP-2 ViT-G OPT 2.7B (zero-shot) | #4 | BLEU-4: 43.7CIDER: 145.8 |
| image-captioning-on-coco-captions | BLIP-2 ViT-G OPT 6.7B (zero-shot) | #5 | BLEU-4: 43.5CIDER: 145.2 |
| image-captioning-on-coco-captions | BLIP-2 ViT-G FlanT5 XL (zero-shot) | #8 | BLEU-4: 42.4CIDER: 144.5 |
| image-captioning-on-nocaps-val-in-domain | BLIP-2 ViT-G FlanT5 XL (zero-shot) | #1 | CIDEr: 123.7SPICE: 16.3Pre-train (#images): 1.1B |
| image-captioning-on-nocaps-val-in-domain | BLIP-2 ViT-G OPT 6.7B (zero-shot) | #2 | CIDEr: 123.7SPICE: 15.8Pre-train (#images): 1.1B |
| image-captioning-on-nocaps-val-in-domain | BLIP-2 ViT-G OPT 2.7B (zero-shot) | #3 | CIDEr: 123SPICE: 15.8Pre-train (#images): 1.1B |
| image-captioning-on-nocaps-val-near-domain | BLIP-2 ViT-G FlanT5 XL (zero-shot) | #1 | CIDEr: 120.2SPICE: 15.9Pre-train (#images): 1.1B |
| image-captioning-on-nocaps-val-near-domain | BLIP-2 ViT-G OPT 6.7B (zero-shot) | #2 | CIDEr: 119.2SPICE: 15.3Pre-train (#images): 1.1B |
| image-captioning-on-nocaps-val-near-domain | BLIP-2 ViT-G OPT 2.7B (zero-shot) | #3 | CIDEr: 117.8SPICE: 15.4Pre-train (#images): 1.1B |
| image-captioning-on-nocaps-val-out-domain | BLIP-2 ViT-G FlanT5 XL (zero-shot) | #1 | CIDEr: 124.8SPICE: 15.1Pretrain (#images): 1.1B |
| image-captioning-on-nocaps-val-out-domain | BLIP-2 ViT-G OPT 6.7B (zero-shot) | #2 | CIDEr: 124.4SPICE: 14.8Pretrain (#images): 1.1B |
| image-captioning-on-nocaps-val-out-domain | BLIP-2 ViT-G OPT 2.7B (zero-shot) | #3 | CIDEr: 123.4SPICE: 15.1Pretrain (#images): 1.1B |
| image-captioning-on-nocaps-val-overall | BLIP-2 ViT-G FlanT5 XL (zero-shot) | #1 | CIDEr: 121.6SPICE: 15.8Pretrain (#images): 1.1B |
| image-captioning-on-nocaps-val-overall | BLIP-2 ViT-G OPT 6.7B (zero-shot) | #2 | CIDEr: 121.0SPICE: 15.3Pretrain (#images): 1.1B |
| image-captioning-on-nocaps-val-overall | BLIP-2 ViT-G OPT 2.7B (zero-shot) | #3 | CIDEr: 119.7SPICE: 15.4Pretrain (#images): 1.1B |
| image-retrieval-on-coco | BLIP-2 ViT-G (fine-tuned) | #1 | recall@1: 68.3recall@5: 87.7Recall@10: 92.6 |
| image-retrieval-on-coco | BLIP-2 ViT-L (fine-tuned) | #3 | recall@1: 66.3recall@5: 86.5Recall@10: 91.8 |
| image-retrieval-on-flickr30k | BLIP-2 ViT-G (zero-shot, 1K test set) | #1 | Recall@10: 98.9Recall@5: 98.1Recall@1: 89.7 |
| image-retrieval-on-flickr30k | BLIP-2 ViT-L (zero-shot, 1K test set) | #2 | Recall@10: 98.9Recall@5: 97.6Recall@1: 88.6 |
| image-to-text-retrieval-on-coco | BLIP-2 (ViT-G, fine-tuned) | #1 | Recall@1: 85.4Recall@5: 97.0Recall@10: 98.5 |
| image-to-text-retrieval-on-coco | BLIP-2 (ViT-L, fine-tuned) | #3 | Recall@1: 83.5Recall@5: 96.0Recall@10: 98.0 |
| image-to-text-retrieval-on-flickr30k | BLIP-2 ViT-G (zero-shot, 1K test set) | #2 | Recall@1: 97.6Recall@5: 100Recall@10: 100 |
| image-to-text-retrieval-on-flickr30k | BLIP-2 ViT-L (zero-shot, 1K test set) | #5 | Recall@1: 96.9Recall@5: 100Recall@10: 100 |
| open-vocabulary-attribute-detection-on-ovad-1 | BLIP 2 (pretrained) | #2 | mean average precision: 25.5 |
| visual-instruction-following-on-llava-bench | BLIP-2 | #8 | avg score: 38.1 |
| visual-question-answering-on-gqa-test-dev | BLIP-2 ViT-G FlanT5 XXL (zero-shot) | #8 | Accuracy: 44.7 |
| visual-question-answering-on-gqa-test-dev | BLIP-2 ViT-L FlanT5 XL (zero-shot) | #9 | Accuracy: 44.4 |
| visual-question-answering-on-gqa-test-dev | BLIP-2 ViT-G FlanT5 XL (zero-shot) | #10 | Accuracy: 44.2 |
| visual-question-answering-on-gqa-test-dev | BLIP-2 ViT-G OPT 6.7B (zero-shot) | #12 | Accuracy: 36.4 |
| visual-question-answering-on-gqa-test-dev | BLIP-2 ViT-G OPT 2.7B (zero-shot) | #13 | Accuracy: 34.6 |
| visual-question-answering-on-gqa-test-dev | BLIP-2 ViT-L OPT 2.7B (zero-shot) | #14 | Accuracy: 33.9 |
| visual-question-answering-on-mm-vet | BLIP-2-12B | #163 | GPT-4 score: 22.4±0.2Params: 12B |
| visual-question-answering-on-ok-vqa | BLIP-2 ViT-G FlanT5 XXL (zero-shot) | #19 | Accuracy: 45.9 |
| visual-question-answering-on-ok-vqa | BLIP-2 ViT-G FlanT5 XL (zero-shot) | #24 | Accuracy: 40.7 |
| visual-question-answering-on-ok-vqa | BLIP-2 ViT-L FlanT5 XL (zero-shot) | #25 | Accuracy: 39.4 |
| visual-question-answering-on-ok-vqa | BLIP-2 ViT-G OPT 6.7B (zero-shot) | #26 | Accuracy: 36.4 |
| visual-question-answering-on-ok-vqa | BLIP-2 ViT-G OPT 2.7B (zero-shot) | #28 | Accuracy: 31.7 |
| visual-question-answering-on-ok-vqa | BLIP-2 ViT-L OPT 2.7B (zero-shot) | #29 | Accuracy: 30.2 |
| visual-question-answering-on-vqa-v2-test-dev | BLIP-2 ViT-G FlanT5 XXL (zero-shot) | #39 | Accuracy: 65 |
| visual-question-answering-on-vqa-v2-test-dev | BLIP-2 ViT-G FlanT5 XL (zero-shot) | #44 | Accuracy: 63 |
| visual-question-answering-on-vqa-v2-test-dev | BLIP-2 ViT-L FlanT5 XL (zero-shot) | #45 | Accuracy: 62.3 |
| visual-question-answering-on-vqa-v2-test-dev | BLIP-2 ViT-G OPT 6.7B (zero-shot) | #47 | Accuracy: 52.6 |
| visual-question-answering-on-vqa-v2-test-dev | BLIP-2 ViT-G OPT 2.7B (zero-shot) | #48 | Accuracy: 52.3 |
| visual-question-answering-on-vqa-v2-test-dev | BLIP-2 ViT-L OPT 2.7B (zero-shot) | #50 | Accuracy: 49.7 |
| visual-question-answering-on-vqa-v2-test-dev-1 | BLIP-2 ViT-G OPT 6.7B (fine-tuned) | #2 | Accuracy: 82.30 |
| visual-question-answering-on-vqa-v2-test-dev-1 | BLIP-2 ViT-G OPT 2.7B (fine-tuned) | #4 | Accuracy: 81.74 |
| visual-question-answering-on-vqa-v2-test-dev-1 | BLIP-2 ViT-G FlanT5 XL (fine-tuned) | #5 | Accuracy: 81.66 |
| visual-question-answering-on-vqa-v2-val | BLIP-2 ViT-G FlanT5 XXL (zero-shot) | #1 | Accuracy: 65.2 |
| visual-question-answering-on-vqa-v2-val | BLIP-2 ViT-G FlanT5 XL (zero-shot) | #3 | Accuracy: 63.1 |
| visual-question-answering-on-vqa-v2-val | BLIP-2 ViT-L FlanT5 XL (zero-shot) | #4 | Accuracy: 62.6 |
| visual-question-answering-on-vqa-v2-val | BLIP-2 ViT-G OPT 6.7B (zero-shot) | #5 | Accuracy: 54.3 |
| visual-question-answering-on-vqa-v2-val | BLIP-2 ViT-G OPT 2.7B (zero-shot) | #6 | Accuracy: 53.5 |
| visual-question-answering-on-vqa-v2-val | BLIP-2 ViT-L OPT 2.7B (zero-shot) | #7 | Accuracy: 50.1 |
| visual-question-answering-on-vqa-v2-val-1 | BLIP-2 ViT-G OPT 6.7B (fine-tuned) | #1 | Accuracy: 82.19 |
| visual-question-answering-on-vqa-v2-val-1 | BLIP-2 ViT-G OPT 2.7B (fine-tuned) | #2 | Accuracy: 81.59 |
| visual-question-answering-on-vqa-v2-val-1 | BLIP-2 ViT-G FlanT5 XL (fine-tuned) | #3 | Accuracy: 81.55 |
| visual-question-answering-vqa-on-core-mm | BLIP-2-OPT2.7B | #12 | Overall score: 19.31Deductive: 2.76Abductive: 18.96Analogical: 7.5… |
| visual-question-answering-vqa-on-infoseek | BLIP2 | #6 | Accuracy: 14.6 |
| visual-question-answering-vqa-on-pmc-vqa | BLIP-2 | #4 | Accuracy: 24.3 |