M2-Encoder: Advancing Bilingual Image-Text Understanding by Large-scale Efficient Pretraining

Benchmark Model Rank Results
zero-shot-cross-modal-retrieval-on-coco-2014M2-Encoder#2Image-to-text R@1: 72.8Image-to-text R@5: 92.3
zero-shot-cross-modal-retrieval-on-flickr30kM2-Encoder#8Image-to-text R@1: 91.2Image-to-text R@5: 99.2
zero-shot-transfer-image-classification-on-1M2-Encoder#1Param: 10BAccuracy (Private): 88.5