VIVO: Visual Vocabulary Pre-Training for Novel Object Captioning

Benchmark Model Rank Results
image-captioning-on-nocaps-entireMicrosoft Cognitive Services teamCIDEr: 114.25B1: 85.62B2: 71.36B3: 53.62B4: 34.65
image-captioning-on-nocaps-in-domainMicrosoft Cognitive Services teamCIDEr: 112.82B1: 86.33B2: 72.83B3: 55.94B4: 37.97
image-captioning-on-nocaps-near-domainMicrosoft Cognitive Services teamCIDEr: 115.54B1: 86.48B2: 72.6B3: 55.26B4: 36.31
image-captioning-on-nocaps-out-of-domainMicrosoft Cognitive Services teamCIDEr: 110.14B1: 81.73B2: 65.48B3: 45.58B4: 25.78
image-captioning-on-nocaps-xd-entireMicrosoft Cognitive Services teamCIDEr: 100.12B1: 82.27B2: 66.04B3: 47.48B4: 28.95
image-captioning-on-nocaps-xd-in-domainMicrosoft Cognitive Services teamCIDEr: 100.62B1: 82.94B2: 67.56B3: 49.66B4: 32.07
image-captioning-on-nocaps-xd-near-domainMicrosoft Cognitive Services teamCIDEr: 101.2B1: 82.88B2: 67.01B3: 48.73B4: 30.21
image-captioning-on-nocaps-xd-out-of-domainMicrosoft Cognitive Services teamCIDEr: 95.5B1: 79.44B2: 61.15B3: 41.03B4: 21.79