Diverse Video Captioning by Adaptive Spatio-temporal Attention

Benchmark Model Rank Results
video-captioning-on-msr-vtt-1VASTA (Vatex-backbone)#13CIDEr: 56.08METEOR: 30.24ROUGE-L: 62.9BLEU-4: 44.21
video-captioning-on-msr-vtt-1VASTA (Kinetics-backbone)#14CIDEr: 55METEOR: 30.2ROUGE-L: 62.5BLEU-4: 43.4
video-captioning-on-msvd-1VASTA (Vatex-backbone)#10CIDEr: 119.7BLEU-4: 59.2METEOR: 40.65ROUGE-L: 76.7
video-captioning-on-msvd-1VASTA (Kinetics-backbone)#11CIDEr: 106.4BLEU-4: 56.1METEOR: 39.1ROUGE-L: 74.5
video-captioning-on-vatex-1VASTA (Kinetics-backbone)#4BLEU-4: 36.25CIDEr: 65.07METEOR: 25.32ROUGE-L: 51.88