TACo: Token-aware Cascade Contrastive Learning for Video-Text Alignment

Benchmark Model Rank Results
action-segmentation-on-coinTACoFrame accuracy: 68.4
temporal-action-localization-on-crosstaskTACoRecall: 42.5
video-retrieval-on-activitynetTACotext-to-video R@1: 30.4text-to-video R@5: 61.2
video-retrieval-on-msr-vttTACotext-to-video R@1: 24.8text-to-video R@5: 52.1
video-retrieval-on-msr-vtt-1kaTACotext-to-video R@1: 28.4text-to-video R@5: 57.8
video-retrieval-on-youcook2TACotext-to-video R@1: 29.6text-to-video R@5: 59.7
zero-shot-video-retrieval-on-msr-vttTACotext-to-video R@1: 9.8text-to-video R@5: 25.0text-to-video R@10: 33.4
zero-shot-video-retrieval-on-youcook2TACotext-to-video R@1: 19.9text-to-video R@5: 43.2