Position-guided Text Prompt for Vision-Language Pre-training

Benchmark Model Rank Results
cross-modal-retrieval-on-coco-2014PTP-BLIP (14M)#6Text-to-image R@1: 64.9Text-to-image R@5: 87.4
image-captioning-on-coco-captionsPTP-BLIP (14M)#18BLEU-4: 40.1CIDER: 135.0METEOR: 30.4SPICE: 23.7
zero-shot-cross-modal-retrieval-on-coco-2014PTP-BLIP#5Image-to-text R@1: 69.7Image-to-text R@5: 90.0
zero-shot-cross-modal-retrieval-on-flickr30kPTP-BLIP (14M)#16Image-to-text R@1: 87.1Image-to-text R@5: 98.4