DiffusionRet: Generative Text-Video Retrieval with Diffusion Model

Benchmark Model Rank Results
video-retrieval-on-activitynetDiffusionRet+QB-Norm#16text-to-video R@1: 48.1text-to-video R@10: 85.7
video-retrieval-on-activitynetDiffusionRet#20text-to-video R@1: 45.8text-to-video R@5: 75.6
video-retrieval-on-didemoDiffusionRet+QB-Norm#20text-to-video R@1: 48.9text-to-video R@5: 75.5
video-retrieval-on-didemoDiffusionRet#25text-to-video R@1: 46.7text-to-video R@5: 74.7
video-retrieval-on-lsmdcDiffusionRet#15text-to-video R@1: 24.4text-to-video R@5: 43.1
video-retrieval-on-msr-vtt-1kaDiffusionRet#16text-to-video R@1: 49.0text-to-video R@5: 75.2
video-retrieval-on-msr-vtt-1kaDiffusionRet+QB-Norm#17text-to-video R@1: 48.9text-to-video R@5: 75.2
video-retrieval-on-msvdDiffusionRet+QB-Norm#11text-to-video R@1: 47.9text-to-video R@5: 77.2
video-retrieval-on-msvdDiffusionRet#14text-to-video R@1: 46.6text-to-video R@5: 75.9