Scaling Up Vision-Language Pre-training for Image Captioning

Benchmark Model Rank Results
image-captioning-on-coco-captionsLEMONBLEU-4: 42.6CIDER: 145.5METEOR: 31.4SPICE: 25.5
image-captioning-on-nocaps-val-in-domainLEMON_baseCIDEr: 107.7SPICE: 14.7Pre-train (#images): 200M
image-captioning-on-nocaps-val-in-domainLEMON_largeCIDEr: 116.9SPICE: 15.8Pre-train (#images): 200M
image-captioning-on-nocaps-val-near-domainLEMON_largeCIDEr: 113.3SPICE: 15.1Pre-train (#images): 200M
image-captioning-on-nocaps-val-out-domainLEMON_largeCIDEr: 111.3SPICE: 14.0Pretrain (#images): 200M
image-captioning-on-nocaps-val-overallLEMON_largeCIDEr: 113.4SPICE: 15.0Pretrain (#images): 200M
image-captioning-on-nocaps-xd-entireMicrosoft Cognitive Services teamCIDEr: 114.25B1: 85.62B2: 71.36B3: 53.62B4: 34.65