Gramian Multimodal Representation Learning and Alignment

Benchmark Model Rank Results
video-retrieval-on-activitynetGRAM#4text-to-video R@1: 69.9text-to-video R@10: 96.1
video-retrieval-on-didemoGRAM#6text-to-video R@1: 67.3text-to-video R@10: 90.1
video-retrieval-on-msr-vttGRAM#1text-to-video R@1: 64text-to-video R@10: 89.3video-to-text R@1: 64.8
video-retrieval-on-vatexGRAM#1text-to-video R@1: 87.7text-to-video R@10: 100video-to-text R@1: 84.6
zero-shot-video-retrieval-on-activitynetGRAM#3text-to-video R@1: 59.0text-to-video R@10: 91.2
zero-shot-video-retrieval-on-didemoGRAM#4text-to-video R@1: 54.2text-to-video R@10: 80.7
zero-shot-video-retrieval-on-msr-vttGRAM#2text-to-video R@1: 54.8text-to-video R@10: 83.9
zero-shot-video-retrieval-on-vatexGRAM#1text-to-video R@1: 83.9text-to-video R@10: 99.5