Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning

Benchmark Model Rank Results
dense-video-captioning-on-activitynetVid2Seq#1METEOR: 17CIDEr: 28
dense-video-captioning-on-vittVid2Seq#2SODA: 0.135CIDEr: 43.5METEOR: 8.5
dense-video-captioning-on-youcook2Vid2Seq#2CIDEr: 47.1METEOR: 9.3SODA: 7.9
video-captioning-on-msr-vtt-1Vid2Seq#9CIDEr: 64.6METEOR: 30.8
video-captioning-on-msvd-1Vid2Seq#6CIDEr: 146.2METEOR: 45.3