Deep Visual-Semantic Alignments for Generating Image Descriptions

Benchmark Model Rank Results
cross-modal-retrieval-on-coco-2014Dual-Path (ResNet)#30Text-to-image R@1: 25.3Text-to-image R@5: 53.4
image-captioning-on-flickr30k-captions-testBRNN#2BLEU-4: 15.7CIDEr: 24.7METEOR: 15.3
image-retrieval-on-flickr30k-1k-testDVSA (R-CNN, AlexNet)#15R@1: 15.2R@10: 50.5
image-to-text-retrieval-on-cocoDVSA#8Recall@10: 74.8