Dynamic Self-adaptive Multiscale Distillation from Pre-trained Multimodal Large Model for Efficient Cross-modal Representation Learning

Benchmark Model Rank Results
cross-modal-retrieval-on-coco-2014DSMD#11Text-to-image R@1: 62.1Text-to-image R@5: 85.9
cross-modal-retrieval-on-flickr30kDSMD#11Image-to-text R@1: 82.5Image-to-text R@5: 95.5