VirTex: Learning Visual Representations from Textual Annotations

Benchmark Model Rank Results
image-captioning-on-coco-captionsVirtex (ResNet-101)#34CIDER: 94SPICE: 18.5
instance-segmentation-on-cocoVirTex Mask R-CNN (ResNet-50-FPN)#90mask AP: 36.9AP50: 58.4AP75: 39.7
object-detection-on-coco-minivalVirTex Mask R-CNN (ResNet-50-FPN)#170box AP: 40.9