Transformer Decoders with MultiModal Regularization for Cross-Modal Food Retrieval

Benchmark Model Rank Results
cross-modal-retrieval-on-recipe1mT-Food (CLIP)#3Image-to-text R@1: 72.3Text-to-image R@1: 72.6
cross-modal-retrieval-on-recipe1mT-Food#4Image-to-text R@1: 68.2Text-to-image R@1: 68.3