ClipCap: CLIP Prefix for Image Captioning

Benchmark Model Rank Results
image-captioning-on-coco-captionsClipCap (Transformer)#27BLEU-4: 33.53CIDER: 113.08METEOR: 27.45SPICE: 21.05
image-captioning-on-coco-captionsClipCap (MLP + GPT2 tuning)#28BLEU-4: 32.15CIDER: 108.35METEOR: 27.1SPICE: 20.12
image-captioning-on-nocaps-entireClipCap (Transformer)#5CIDEr: 65.83SPICE: 10.86
image-captioning-on-nocaps-entireClipCap (MLP + GPT2 tuning)#6CIDEr: 65.7SPICE: 11.1
image-captioning-on-nocaps-in-domainClipCap (Transformer)#8CIDEr: 84.85SPICE: 12.14
image-captioning-on-nocaps-in-domainClipCap (MLP + GPT2 tuning)#9CIDEr: 79.73SPICE: 12.2
image-captioning-on-nocaps-near-domainClipCap (MLP + GPT2 tuning)#6CIDEr: 67.69SPICE: 11.26
image-captioning-on-nocaps-near-domainClipCap (Transformer)#7CIDEr: 66.82SPICE: 10.92
image-captioning-on-nocaps-out-of-domainClipCap (MLP + GPT2 tuning)#7CIDEr: 49.35SPICE: 9.7
image-captioning-on-nocaps-out-of-domainClipCap (Transformer)#8CIDEr: 49.14SPICE: 9.57