MaMMUT: A Simple Architecture for Joint Learning for MultiModal Tasks

Benchmark Model Rank Results
cross-modal-retrieval-on-coco-2014MaMMUT (ours)#31Image-to-text R@1: 70.7Image-to-text R@5: 89.1
image-retrieval-on-flickr30kMaMMUT (ours)#4Recall@10: 98Recall@5: 96Recall@1: 82.5Image-to-text R@1: 94.9
video-captioning-on-msr-vtt-1MaMMUT (ours)#6CIDEr: 73.6
video-captioning-on-msvd-1MaMMUT#1CIDEr: 195.6
visual-question-answering-on-msrvtt-qa-1MaMMUT#1Accuracy: 0.495
visual-question-answering-on-msvd-qa-1MaMMUT (ours)#2Accuracy: .602