Advancing High-Resolution Video-Language Representation with Large-Scale Video Transcriptions

Benchmark Model Rank Results
video-retrieval-on-activitynetHD-VILA#25text-to-video R@1: 28.5text-to-video R@5: 57.4text-to-video R@50: 94
video-retrieval-on-didemoHD-VILA#31text-to-video R@1: 28.8text-to-video R@5: 57.4
video-retrieval-on-lsmdcHD-VILA#22text-to-video R@1: 17.4text-to-video R@5: 34.1
video-retrieval-on-msr-vttHD-VILA#13text-to-video R@1: 35.6text-to-video R@5: 65.3text-to-video R@10: 78
zero-shot-video-retrieval-on-msr-vttHD-VILA#29text-to-video R@1: 14.6text-to-video R@5: 34.4