| Benchmark | Model | Rank | Results |
|---|---|---|---|
| cross-modal-retrieval-on-coco-2014 | MaMMUT (ours) | #31 | Image-to-text R@1: 70.7Image-to-text R@5: 89.1… |
| image-retrieval-on-flickr30k | MaMMUT (ours) | #4 | Recall@10: 98Recall@5: 96Recall@1: 82.5Image-to-text R@1: 94.9… |
| video-captioning-on-msr-vtt-1 | MaMMUT (ours) | #6 | CIDEr: 73.6 |
| video-captioning-on-msvd-1 | MaMMUT | #1 | CIDEr: 195.6 |
| visual-question-answering-on-msrvtt-qa-1 | MaMMUT | #1 | Accuracy: 0.495 |
| visual-question-answering-on-msvd-qa-1 | MaMMUT (ours) | #2 | Accuracy: .602 |