UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation

Benchmark Model Rank Results
action-segmentation-on-coinUnivl#2Frame accuracy: 70.0
video-captioning-on-youcook2UniVL#3BLEU-4: 17.35BLEU-3: 23.87CIDEr: 1.81ROUGE-L: 46.52
video-retrieval-on-msr-vttUniVL#24text-to-video R@1: 21.2text-to-video R@5: 49.6
video-retrieval-on-youcook2UniVL#4text-to-video R@1: 28.9text-to-video R@5: 57.6