Dynamic Self-adaptive Multiscale Distillation from Pre-trained Multimodal Large Model for Efficient Cross-modal Representation Learning
Open paper
Benchmark
Model
Rank
Results
cross-modal-retrieval-on-coco-2014
DSMD
#11
Text-to-image R@1: 62.1
Text-to-image R@5: 85.9
…
cross-modal-retrieval-on-flickr30k
DSMD
#11
Image-to-text R@1: 82.5
Image-to-text R@5: 95.5
…
Rank counts only results with a code link.