Exploring Target Representations for Masked Autoencoders

Benchmark Model Rank Results
image-classification-on-imagenetdBOT ViT-H (CLIP as Teacher)#56Top 1 Accuracy: 88.2%
image-classification-on-imagenetdBOT ViT-L (CLIP as Teacher)#71Top 1 Accuracy: 87.8%
image-classification-on-imagenetdBOT ViT-B (CLIP as Teacher)#204Top 1 Accuracy: 85.7%
instance-segmentation-on-cocodBOT ViT-L (CLIP)#25mask AP: 48.8
instance-segmentation-on-cocodBOT ViT-L#28mask AP: 48.3
instance-segmentation-on-cocodBOT ViT-B#35mask AP: 46.3
instance-segmentation-on-cocodBOT ViT-B (CLIP)#36mask AP: 46.2
object-detection-on-cocodBOT ViT-L (CLIP)#38box mAP: 56.8
object-detection-on-cocodBOT ViT-L#44box mAP: 56.1
object-detection-on-cocodBOT ViT-B (CLIP)#58box mAP: 53.6
object-detection-on-cocodBOT ViT-B#61box mAP: 53.5
self-supervised-image-classification-on-1dBOT (ViT-H/14)#6Top 1 Accuracy: 88.0%Number of Params: 632M
semantic-segmentation-on-ade20kdBOT ViT-L (CLIP)#40Validation mIoU: 56.2
semantic-segmentation-on-ade20kdBOT ViT-L#47Validation mIoU: 55.2
semantic-segmentation-on-ade20kdBOT ViT-B (CLIP)#82Validation mIoU: 52.9
semantic-segmentation-on-ade20kdBOT ViT-B#106Validation mIoU: 50.8