An Empirical Study of Training End-to-End Vision-and-Language Transformers
Open paper
Benchmark
Model
Rank
Results
cross-modal-retrieval-on-coco-2014
METER
#18
Text-to-image R@1: 57.08
Text-to-image R@5: 82.66
…
Rank counts only results with a code link.