Tencent Text-Video Retrieval: Hierarchical Cross-Modal Interactions with Multi-Level Representations

Benchmark Model Rank Results
video-retrieval-on-activitynetHunYuan_tvrtext-to-video R@1: 57.3text-to-video R@5: 84.8
video-retrieval-on-didemoHunYuan_tvrtext-to-video R@1: 52.1text-to-video R@5: 78.2
video-retrieval-on-didemoHunYuan_tvr (huge)text-to-video R@1: 52.7text-to-video R@5: 77.8
video-retrieval-on-lsmdcHunYuan_tvrtext-to-video R@1: 29.7text-to-video R@5: 46.4
video-retrieval-on-lsmdcHunYuan_tvr (huge)text-to-video R@1: 40.4text-to-video R@5: 80.1
video-retrieval-on-msr-vtt-1kaHunYuan_tvrtext-to-video R@1: 55.0video-to-text R@1: 55.5video-to-text R@5: 78.4
video-retrieval-on-msr-vtt-1kaHunYuan_tvr (huge)text-to-video R@1: 62.9text-to-video R@5: 84.5
video-retrieval-on-msvdHunYuan_tvrtext-to-video R@1: 58.2text-to-video R@5: 83.5
video-retrieval-on-msvdHunYuan_tvr (huge)text-to-video R@1: 59.0text-to-video R@5: 84.0