Improving Visual Representation Learning through Perceptual Understanding

Benchmark Model Rank Results
self-supervised-image-classification-on-imagenetPercMAE (ViT-B, dVAE)#28Top 1 Accuracy: 79.8%Number of Params: 80M
self-supervised-image-classification-on-imagenetPercMAE (ViT-B)#44Top 1 Accuracy: 78.1%Number of Params: 80M
self-supervised-image-classification-on-imagenet-finetunedPercMAE (ViT-L, dVAE)#2Top 1 Accuracy: 88.6%Number of Params: 307M
self-supervised-image-classification-on-imagenet-finetunedPercMAE (ViT-L)#5Top 1 Accuracy: 88.1%Number of Params: 307M