Align and Prompt: Video-and-Language Pre-training with Entity Prompts

Benchmark Model Rank Results
video-retrieval-on-didemoALPRO#29text-to-video R@1: 35.9text-to-video R@5: 67.5
visual-question-answering-on-msrvtt-qa-1ALPRO#17Accuracy: 0.421
visual-question-answering-on-msvd-qa-1ALPRO#23Accuracy: 0.459
zero-shot-video-retrieval-on-didemoALPRO#17text-to-video R@1: 23.8text-to-video R@5: 47.3
zero-shot-video-retrieval-on-msr-vttALPRO#27text-to-video R@1: 24.1text-to-video R@5: 44.7