Conceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual Concepts

Benchmark Model Rank Results
image-captioning-on-nocaps-val-in-domainEnc-Dec#8CIDEr: 92.6SPICE: 12.5Pre-train (#images): 15M
image-captioning-on-nocaps-val-near-domainEnc-Dec#8CIDEr: 88.3SPICE: 12.1
image-captioning-on-nocaps-val-out-domainEnc-Dec#7CIDEr: 94.5SPICE: 11.9
image-captioning-on-nocaps-val-overallEnc-Dec#8CIDEr: 90.2SPICE: 12.1