3SHNet: Boosting Image-Sentence Retrieval via Visual Semantic-Spatial Self-Highlighting

Benchmark Model Rank Results
cross-modal-retrieval-on-coco-20143SHNet#20Text-to-image R@1: 50.3Text-to-image R@5: 79.3
cross-modal-retrieval-on-flickr30k3SHNet#9Image-to-text R@1: 87.1Image-to-text R@5: 98.2