Clover: Towards A Unified Video-Language Alignment and Fusion Model

Benchmark Model Rank Results
video-question-answering-on-msrvtt-mcClover#3Accuracy: 95.2
video-retrieval-on-didemoClover#18text-to-video R@1: 50.1text-to-video R@5: 76.7
video-retrieval-on-lsmdcClover#14text-to-video R@1: 24.8text-to-video R@5: 44text-to-video R@10: 54.5
video-retrieval-on-msr-vtt-1kaClover#33text-to-video R@1: 40.5text-to-video R@5: 69.8
visual-question-answering-on-msrvtt-qa-1Clover#13Accuracy: 0.441
visual-question-answering-on-msvd-qa-1Clover#15Accuracy: 0.524
zero-shot-video-retrieval-on-didemoClover#14text-to-video R@1: 29.5text-to-video R@5: 55.2
zero-shot-video-retrieval-on-lsmdcClover#11text-to-video R@1: 14.7text-to-video R@5: 29.2
zero-shot-video-retrieval-on-msr-vttClover#22text-to-video R@1: 26.4text-to-video R@5: 49.5text-to-video R@10: 60