Learning Grounded Vision-Language Representation for Versatile Understanding in Untrimmed Videos

Benchmark Model Rank Results
dense-video-captioning-on-activitynetGVL#3METEOR: 10.03CIDEr: 33.33SODA: 7.11
dense-video-captioning-on-youcook2GVL#4CIDEr: 26.52METEOR: 5.01SODA: 4.91
natural-language-moment-retrieval-onGVL (paragraph-level)#1R@1,IoU=0.5: 60.67R@1,IoU=0.7: 38.55
natural-language-moment-retrieval-onGVL#3R@1,IoU=0.5: 49.18R@1,IoU=0.7: 29.69
natural-language-moment-retrieval-on-tacosGVL (paragraph-level)#10R@1,IoU=0.3: 48.29R@1,IoU=0.5: 36.07
natural-language-moment-retrieval-on-tacosGVL#11R@1,IoU=0.3: 45.92R@1,IoU=0.5: 34.57