Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training

Benchmark Model Rank Results
image-text-matching-on-commercialadsdatasetUnicoder-VLADD(S) AUC: 83.16
image-to-text-retrieval-on-cocoUnicoder-VLRecall@10: 97.2