Masked Autoencoders Are Scalable Vision Learners

Benchmark Model Rank Results
domain-generalization-on-imagenet-aMAE (ViT-H, 448)#5Top-1 accuracy %: 76.7
domain-generalization-on-imagenet-cMAE (ViT-H)#6mean Corruption Error (mCE): 33.8Number of params: 632M
domain-generalization-on-imagenet-rMAE (ViT-H, 448)#9Top-1 Error Rate: 33.5
domain-generalization-on-imagenet-sketchMAE (ViT-H, 448)#9Top-1 accuracy: 50.9
image-classification-on-imagenetMAE (ViT-H, 448)#67Top 1 Accuracy: 87.8%Number of params: 656M
image-classification-on-imagenetMAE (ViT-H)#113Top 1 Accuracy: 86.9%
image-classification-on-imagenetMAE (ViT-L)#182Top 1 Accuracy: 85.9%
image-classification-on-imagenetMAE (ViT-L)#402Top 1 Accuracy: 83.6%
image-classification-on-inaturalistMAE (ViT-H, 448)#3Top 1 Accuracy: 83.4
image-classification-on-inaturalist-2018MAE (ViT-H, 448)#5Top-1 Accuracy: 86.8%
image-classification-on-inaturalist-2019MAE (ViT-H, 448)#2Top-1 Accuracy: 88.3
image-classification-on-omnibenchmarkMAE#21Average Top-1 Accuracy: 30.6
image-classification-on-places205MAE (ViT-H, 448)#5Top 1 Accuracy: 66.8
image-classification-on-places365-standardMAE (ViT-H, 448)#3Top 1 Accuracy: 60.3
object-detection-on-coco-minivalMAE (ViT-L, Mask R-CNN)#61box AP: 53.3
object-detection-on-coco-minivalMAE (ViT-B, Mask R-CNN)#79box AP: 50.3
self-supervised-image-classification-on-1MAE (ViT-H/14, 448)#7Top 1 Accuracy: 87.8%Number of Params: 632M
self-supervised-image-classification-on-1MAE (ViT-H/14)#11Top 1 Accuracy: 86.9%
self-supervised-image-classification-on-imagenetMAE (ViT-H)#54Top 1 Accuracy: 76.6%Number of Params: 700M
self-supervised-image-classification-on-imagenetMAE (ViT-L)#61Top 1 Accuracy: 75.8%Number of Params: 306M
self-supervised-image-classification-on-imagenetMAE (ViT-B)#100Top 1 Accuracy: 68.0%Number of Params: 80M
semantic-segmentation-on-ade20kMAE (ViT-L, UperNet)#75Validation mIoU: 53.6
semantic-segmentation-on-ade20kMAE (ViT-B, UperNet)#149Validation mIoU: 48.1
semantic-segmentation-on-imagenet-sMAE (ViT-B/16, 224x224, SSL+FT, mmseg)#4mIoU (val): 61.6mIoU (test): 61.2
semantic-segmentation-on-imagenet-sMAE (ViT-B/16, 224x224, SSL+FT)#5mIoU (val): 61.0mIoU (test): 60.2
semantic-segmentation-on-imagenet-sMAE (ViT-B/16, 224x224, SSL, mmseg)#17mIoU (val): 40.0mIoU (test): 40.3
semantic-segmentation-on-imagenet-sMAE (ViT-B/16, 224x224, SSL)#18mIoU (val): 38.3mIoU (test): 37.0