OmniVL:One Foundation Model for Image-Language and Video-Language Tasks

Benchmark Model Rank Results
action-classification-on-kinetics-400OmniVLAcc@1: 79.1Acc@5: 94.5
action-recognition-in-videos-on-somethingOmniVLTop-1 Accuracy: 62.5Top-5 Accuracy: 86.2
cross-modal-retrieval-on-coco-2014OmniVL (14M)Text-to-image R@1: 64.8Text-to-image R@5: 86.1
cross-modal-retrieval-on-flickr30kOmniVL (14M)Image-to-text R@1: 97.3Image-to-text R@5: 99.9Image-to-text R@10: 100
image-captioning-on-nocaps-val-in-domainOmniVLCIDEr: 104.6SPICE: 15Pre-train (#images): 14M
image-captioning-on-nocaps-val-near-domainOmniVLCIDEr: 108.3SPICE: 14.9Pre-train (#images): 14M
image-captioning-on-nocaps-val-out-domainOmniVLCIDEr: 106.3SPICE: 14.2Pretrain (#images): 14M
image-captioning-on-nocaps-val-overallOmniVLCIDEr: 107.5SPICE: 14.7Pretrain (#images): 14M
video-captioning-on-youcook2OmniVLBLEU-4: 8.72BLEU-3: 12.87CIDEr: 1.16ROUGE-L: 36.09METEOR: 14.83
video-retrieval-on-didemoOmniVLtext-to-video R@1: 52.4text-to-video R@5: 79.5
video-retrieval-on-msr-vttOmniVLtext-to-video R@1: 47.8text-to-video R@5: 74.2
visual-question-answering-on-msrvtt-qa-1OmniVLAccuracy: 0.441
visual-question-answering-on-msvd-qa-1OmniVLAccuracy: 0.510
zero-shot-video-retrieval-on-didemoOmniVLtext-to-video R@1: 33.3text-to-video R@5: 58.7
zero-shot-video-retrieval-on-msr-vttOmniVLtext-to-video R@1: 34.6text-to-video R@5: 58.4