| action-classification-on-kinetics-400 | OmniVL | – | Acc@1: 79.1Acc@5: 94.5 |
| action-recognition-in-videos-on-something | OmniVL | – | Top-1 Accuracy: 62.5Top-5 Accuracy: 86.2 |
| cross-modal-retrieval-on-coco-2014 | OmniVL (14M) | – | Text-to-image R@1: 64.8Text-to-image R@5: 86.1… |
| cross-modal-retrieval-on-flickr30k | OmniVL (14M) | – | Image-to-text R@1: 97.3Image-to-text R@5: 99.9Image-to-text R@10: 100… |
| image-captioning-on-nocaps-val-in-domain | OmniVL | – | CIDEr: 104.6SPICE: 15Pre-train (#images): 14M |
| image-captioning-on-nocaps-val-near-domain | OmniVL | – | CIDEr: 108.3SPICE: 14.9Pre-train (#images): 14M |
| image-captioning-on-nocaps-val-out-domain | OmniVL | – | CIDEr: 106.3SPICE: 14.2Pretrain (#images): 14M |
| image-captioning-on-nocaps-val-overall | OmniVL | – | CIDEr: 107.5SPICE: 14.7Pretrain (#images): 14M |
| video-captioning-on-youcook2 | OmniVL | – | BLEU-4: 8.72BLEU-3: 12.87CIDEr: 1.16ROUGE-L: 36.09METEOR: 14.83 |
| video-retrieval-on-didemo | OmniVL | – | text-to-video R@1: 52.4text-to-video R@5: 79.5… |
| video-retrieval-on-msr-vtt | OmniVL | – | text-to-video R@1: 47.8text-to-video R@5: 74.2… |
| visual-question-answering-on-msrvtt-qa-1 | OmniVL | – | Accuracy: 0.441 |
| visual-question-answering-on-msvd-qa-1 | OmniVL | – | Accuracy: 0.510 |
| zero-shot-video-retrieval-on-didemo | OmniVL | – | text-to-video R@1: 33.3text-to-video R@5: 58.7… |
| zero-shot-video-retrieval-on-msr-vtt | OmniVL | – | text-to-video R@1: 34.6text-to-video R@5: 58.4… |