An Empirical Study of Training End-to-End Vision-and-Language Transformers

Benchmark Model Rank Results
cross-modal-retrieval-on-coco-2014METER#18Text-to-image R@1: 57.08Text-to-image R@5: 82.66…