Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN

Benchmark Model Rank Results
instance-segmentation-on-cocoA2MIM (ViT-B)#45mask AP: 43.5
instance-segmentation-on-cocoA2MIM (ResNet-50 2x)#93mask AP: 34.9
object-detection-on-cocoA2MIM (ViT-B)#96box mAP: 49.4
object-detection-on-cocoA2MIM (ResNet-50 2x)#198box mAP: 39.8
self-supervised-image-classification-on-1A2MIM+ (ViT-B)#30Top 1 Accuracy: 84.5%
self-supervised-image-classification-on-1A2MIM (ViT-B)#34Top 1 Accuracy: 84.2%
self-supervised-image-classification-on-1A2MIM+ (ViT-S)#51Top 1 Accuracy: 82.4%
self-supervised-image-classification-on-1A2MIM (ViT-S)#52Top 1 Accuracy: 82.2%
self-supervised-image-classification-on-1A2MIM+ (ResNet-50 RSB-A2)#56Top 1 Accuracy: 80.5%
self-supervised-image-classification-on-1A2MIM (ResNet-50 RSB-A2)#57Top 1 Accuracy: 80.4%
self-supervised-image-classification-on-1A2MIM+ (ResNet-50 RSB-A3)#58Top 1 Accuracy: 78.9%
self-supervised-image-classification-on-1A2MIM (ResNet-50 RSB-A3)#59Top 1 Accuracy: 78.8%
semantic-segmentation-on-ade20kA2MIM (ViT-B)#137Validation mIoU: 49
semantic-segmentation-on-ade20kA2MIM (ResNet-50)#214Validation mIoU: 38.3