Transformer Decoders with MultiModal Regularization for Cross-Modal Food Retrieval
Open paper
Benchmark
Model
Rank
Results
cross-modal-retrieval-on-recipe1m
T-Food (CLIP)
#3
Image-to-text R@1: 72.3
Text-to-image R@1: 72.6
cross-modal-retrieval-on-recipe1m
T-Food
#4
Image-to-text R@1: 68.2
Text-to-image R@1: 68.3
Rank counts only results with a code link.