Multimodal Clustering Networks for Self-supervised Learning from Unlabeled Videos

Benchmark Model Rank Results
long-video-retrieval-background-removed-onMCN#4Cap. Avg. R@1: 53.4Cap. Avg. R@5: 75.0Cap. Avg. R@10: 81.4