GRIT: Faster and Better Image captioning Transformer Using Dual Visual Features

Benchmark Model Rank Results
image-captioning-on-coco-captionsGRIT (No VL pretraining - base)#7BLEU-4: 42.4CIDER: 144.2METEOR: 30.6SPICE: 24.3ROUGE-L: 60.7
image-captioning-on-nocaps-in-domainGRIT (zero-shot, no VL pretraining, no CBS)#6CIDEr: 105.9SPICE: 13.6
image-captioning-on-nocaps-out-of-domainGRIT (zero-shot, no CBS, no VL pretraining, single model)#6CIDEr: 72.6SPICE: 11.1