COSA: Concatenated Sample Pretrained Vision-Language Foundation Model

Benchmark Model Rank Results
video-captioning-on-msr-vtt-1COSA#4CIDEr: 74.7BLEU-4: 53.7
video-captioning-on-msvd-1COSA#3CIDEr: 178.5BLEU-4: 76.5
video-captioning-on-vatex-1COSA#3BLEU-4: 43.7CIDEr: 96.5
video-captioning-on-youcook2COSA#7BLEU-4: 10.1CIDEr: 1.31
video-question-answering-on-activitynet-qaCOSA#2Accuracy: 49.9
video-question-answering-on-msrvtt-qaCOSA#3Accuracy: 49.2
video-retrieval-on-activitynetCOSA#5text-to-video R@1: 67.3
video-retrieval-on-didemoCOSA#4text-to-video R@1: 70.5
video-retrieval-on-lsmdcCOSA#4text-to-video R@1: 39.4
video-retrieval-on-msr-vttCOSA#7text-to-video R@1: 57.9
visual-question-answering-on-msvd-qa-1COSA#5Accuracy: 0.60