HiTeA: Hierarchical Temporal-Aware Video-Language Pre-training

Benchmark Model Rank Results
video-captioning-on-msr-vtt-1HiTeACIDEr: 65.1METEOR: 30.7ROUGE-L: 65.0BLEU-4: 49.2
video-captioning-on-msvd-1HiTeACIDEr: 146.9BLEU-4: 71.0METEOR: 45.3ROUGE-L: 81.4
video-question-answering-on-msrvtt-mcHiTeAAccuracy: 97.4
video-question-answering-on-next-qaHiTeAAccuracy: 63.1
video-retrieval-on-activitynetHiTeAtext-to-video R@1: 49.7text-to-video R@5: 77.1
video-retrieval-on-didemoHiTeAtext-to-video R@1: 56.5text-to-video R@5: 81.7
video-retrieval-on-lsmdcHiTeAtext-to-video R@1: 28.7text-to-video R@5: 50.3
video-retrieval-on-msr-vtt-1kaHiTeAtext-to-video R@1: 46.8text-to-video R@5: 71.2
video-retrieval-on-ssv2-label-retrievalHiTeAtext-to-video R@1: 55.2text-to-video R@5: 89.1
video-retrieval-on-ssv2-template-retrievalHiTeAtext-to-video R@1: 85.6text-to-video R@10: 100text-to-video R@5: 100
visual-question-answering-on-msrvtt-qa-1HiTeAAccuracy: 0.459
visual-question-answering-on-msvd-qa-1HiTeAAccuracy: 0.556
zero-shot-video-retrieval-on-didemoHiTeA-17Mtext-to-video R@1: 43.2text-to-video R@5: 69.3
zero-shot-video-retrieval-on-didemoHiTeA-5Mtext-to-video R@1: 36.1text-to-video R@5: 60.1
zero-shot-video-retrieval-on-lsmdcHiTeA-17Mtext-to-video R@1: 18.3text-to-video R@5: 36.7
zero-shot-video-retrieval-on-lsmdcHiTeA-5Mtext-to-video R@1: 15.5text-to-video R@5: 31.1
zero-shot-video-retrieval-on-msr-vttHiTeA-17Mtext-to-video R@1: 34.4text-to-video R@5: 60.0
zero-shot-video-retrieval-on-msr-vttHiTeA-5Mtext-to-video R@1: 29.9text-to-video R@5: 54.2