Multi-granularity Correspondence Learning from Long-term Noisy Videos

Benchmark Model Rank Results
action-segmentation-on-coinNorton#3Frame accuracy: 69.8
long-video-retrieval-background-removed-onNorton#1Cap. Avg. R@1: 75.5Cap. Avg. R@5: 95.0Cap. Avg. R@10: 97.7
video-question-answering-on-msrvtt-mcNorton#5Accuracy: 92.7
zero-shot-video-retrieval-on-msr-vttNorton#30text-to-video R@1: 10.7text-to-video R@5: 24.1
zero-shot-video-retrieval-on-youcook2Norton#1text-to-video R@1: 24.2text-to-video R@5: 51.9