Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training
Open paper
Benchmark
Model
Rank
Results
image-text-matching-on-commercialadsdataset
Unicoder-VL
–
ADD(S) AUC: 83.16
image-to-text-retrieval-on-coco
Unicoder-VL
–
Recall@10: 97.2
Rank counts only results with a code link.