ImageBERT: Cross-modal Pre-training with Large-scale Weak-supervised Image-Text Data

Benchmark Model Rank Results
zero-shot-cross-modal-retrieval-on-coco-2014ImageBERTImage-to-text R@1: 44.0Image-to-text R@5: 71.2
zero-shot-cross-modal-retrieval-on-flickr30kImageBERTImage-to-text R@1: 70.7Image-to-text R@5: 90.2