Efficient Self-supervised Vision Transformers for Representation Learning

Benchmark Model Rank Results
self-supervised-image-classification-on-imagenetEsViT (Swin-B)#15Top 1 Accuracy: 81.3Top 5 Accuracy: 95.5Number of Params: 87M
self-supervised-image-classification-on-imagenetEsViT(Swin-S)#19Top 1 Accuracy: 80.8Number of Params: 49M
self-supervised-image-classification-on-imagenet-finetunedEsViT (Swin-B)#40Top 1 Accuracy: 83.9%Number of Params: 87M