vid-TLDR: Training Free Token merging for Light-weight Video Transformer

Benchmark Model Rank Results
video-retrieval-on-activitynetvid-TLDR (UMT-L)#7text-to-video R@1: 66.7text-to-video R@5: 88.6
video-retrieval-on-didemovid-TLDR (UMT-L)#2text-to-video R@1: 72.3text-to-video R@5: 91.2
video-retrieval-on-lsmdcvid-TLDR (UMT-L)#2text-to-video R@1: 43.1text-to-video R@5: 64.5
video-retrieval-on-msr-vttvid-TLDR (UMT-L)#6text-to-video R@1: 58.1text-to-video R@5: 81.0
video-retrieval-on-msvdvid-TLDR (UMT-L)#3text-to-video R@1: 57.9text-to-video R@5: 83.8
video-retrieval-on-ssv2-label-retrievalvid-TLDR (UMT-L)#2text-to-video R@1: 73.1text-to-video R@5: 93.3
video-retrieval-on-ssv2-template-retrievalvid-TLDR (UMT-L)#2text-to-video R@1: 90.2text-to-video R@10: 100.0
visual-question-answering-on-msrvtt-qa-1vid-TLDR (UMT-L)#7Accuracy: 0.470
visual-question-answering-on-msvd-qa-1vid-TLDR (UMT-L)#11Accuracy: 0.549
zero-shot-video-retrieval-on-activitynetvid-TLDR (UMT-L)#5text-to-video R@1: 42.8text-to-video R@5: 69.4
zero-shot-video-retrieval-on-didemovid-TLDR (UMT-L)#5text-to-video R@1: 52.0text-to-video R@5: 74.0
zero-shot-video-retrieval-on-msr-vttvid-TLDR (UMT-L)#12text-to-video R@1: 42.1text-to-video R@5: 63.9
zero-shot-video-retrieval-on-msvdvid-TLDR (UMT-L)#6text-to-video R@1: 50.0text-to-video R@5: 77.6