Masking meets Supervision: A Strong Learning Alliance

Benchmark Model Rank Results
image-classification-on-imagenetViT-H @224 (DeiT-III + AugSub)#207Top 1 Accuracy: 85.7%Number of params: 632M
image-classification-on-imagenetViT-L @224 (DeiT-III + AugSub)#237Top 1 Accuracy: 85.3%Number of params: 304M
image-classification-on-imagenetViT-B @224 (DeiT-III + AugSub)#334Top 1 Accuracy: 84.2%Number of params: 86.6M
self-supervised-image-classification-on-1MAE + AugSub finetune (ViT-H/14)#9Top 1 Accuracy: 87.2%Number of Params: 632M
self-supervised-image-classification-on-1MAE + AugSub finetune (ViT-L/16)#17Top 1 Accuracy: 86.1%Number of Params: 304M
self-supervised-image-classification-on-1MAE + AugSub finetune (ViT-B/16)#41Top 1 Accuracy: 83.9%Number of Params: 87M