CLIP Meets Video Captioning: Concept-Aware Representation Learning Does Matter
Open paper
Benchmark
Model
Rank
Results
video-captioning-on-msr-vtt-1
CLIP-DCD
#10
CIDEr: 58.7
METEOR: 31.3
ROUGE-L: 64.8
BLEU-4: 48.2
Rank counts only results with a code link.