RTQ: Rethinking Video-language Understanding Based on Image-text Model

Benchmark Model Rank Results
video-captioning-on-msr-vtt-1RTQ#7CIDEr: 69.3ROUGE-L: 66.1BLEU-4: 49.6
video-captioning-on-msvd-1RTQ#8CIDEr: 123.4BLEU-4: 66.9ROUGE-L: 82.2
video-question-answering-on-next-qaRTQ#29Accuracy: 63.2
video-retrieval-on-activitynetRTQ#12text-to-video R@1: 53.5text-to-video R@5: 81.4
video-retrieval-on-didemoRTQ#11text-to-video R@1: 57.6text-to-video R@5: 84.1
video-retrieval-on-msr-vtt-1kaRTQ#6text-to-video R@1: 53.4text-to-video R@5: 76.1