ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked Autoencoders

Benchmark Model Rank Results
action-classification-on-kinetics-400ViC-MAE (ViT-L)#51Acc@1: 85.1
action-recognition-in-videos-on-somethingViC-MAE (ViT-L)#18Top-1 Accuracy: 73.7
image-classification-on-imagenetViC-MAE (ViT-L)#262Top 1 Accuracy: 85%
image-classification-on-places365ViC-MAE (ViT-L)#3Top 1 Accuracy: 59.5%