Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks

Benchmark Model Rank Results
cross-modal-retrieval-on-coco-2014Oscar#17Text-to-image R@1: 57.5Text-to-image R@5: 82.8
image-captioning-on-coco-captionsOscar#10BLEU-4: 41.7CIDER: 140METEOR: 30.6SPICE: 24.5
image-captioning-on-nocaps-val-overallOSCAR#9CIDEr: 80.9SPICE: 11.3Pretrain (#images): 345M
image-retrieval-on-cocoOscar#6Recall@10: 98.3
image-text-matching-on-commercialadsdatasetOSCAR#3ADD(S) AUC: 87.45
image-to-text-retrieval-on-cocoOscar#7Recall@10: 99.8
visual-question-answering-on-vqa-v2-test-devOscar#17Accuracy: 73.82