Contrastive Tuning: A Little Help to Make Masked Autoencoders Forget

Benchmark Model Rank Results
image-clustering-on-imagenetMAE-CT (ViT-H/16 best)#7Accuracy: 58.0NMI: 81.8
image-clustering-on-imagenetMAE-CT (ViT-H/16 mean)#8Accuracy: 57.1NMI: 81.7
image-clustering-on-imagenet-dog-15MAE-CT (best)#1Accuracy: 0.943NMI: 0.904ARI: 0.879Backbone: ViT-H/16
image-clustering-on-imagenet-dog-15MAE-CT (mean)#2Accuracy: 0.874NMI: 0.882ARI: 0.821Backbone: ViT-H/16
self-supervised-image-classification-on-imagenetMAE-CT (ViT-H/16)#12Top 1 Accuracy: 82.2%Number of Params: 632M
self-supervised-image-classification-on-imagenetMAE-CT (ViT-L/16#14Top 1 Accuracy: 81.5%Number of Params: 307M