MixMAE: Mixed and Masked Autoencoder for Efficient Pretraining of Hierarchical Vision Transformers

Benchmark Model Rank Results
image-classification-on-imagenetMixMIM-B#253Top 1 Accuracy: 85.1%Number of params: 88MGFLOPs: 16.3
image-classification-on-inaturalist-2018MixMIM-L#14Top-1 Accuracy: 80.3%
image-classification-on-inaturalist-2018MixMIM-B#20Top-1 Accuracy: 77.5%
image-classification-on-inaturalist-2019MixMIM-L#3Top-1 Accuracy: 83.9
image-classification-on-places205MixMIM-L#2Top 1 Accuracy: 69.3
image-classification-on-places205MixMIM-B#4Top 1 Accuracy: 68.3
image-classification-on-places365MixMIM-L(ViT-L)#2Top 1 Accuracy: 60.3
image-classification-on-places365MixMIM-B (ViT)#5Top 1 Accuracy: 58.9
object-detection-on-coco-2017MixMIM-L#10mAP: 54.1
object-detection-on-coco-2017MixMIM-B#12mAP: 52.2
semantic-segmentation-on-ade20k-valMixMIM-L#36mIoU: 53.8
semantic-segmentation-on-ade20k-valMixMIM-B#50mIoU: 50.3