3SHNet: Boosting Image-Sentence Retrieval via Visual Semantic-Spatial Self-Highlighting
Open paper
Benchmark
Model
Rank
Results
cross-modal-retrieval-on-coco-2014
3SHNet
#20
Text-to-image R@1: 50.3
Text-to-image R@5: 79.3
…
cross-modal-retrieval-on-flickr30k
3SHNet
#9
Image-to-text R@1: 87.1
Image-to-text R@5: 98.2
…
Rank counts only results with a code link.