SP-ViT: Learning 2D Spatial Priors for Vision Transformers

Benchmark Model Rank Results
image-classification-on-imagenetOur SP-ViT-L|384#157Top 1 Accuracy: 86.3%
image-classification-on-imagenetOur SP-ViT-M|384#177Top 1 Accuracy: 86%
image-classification-on-imagenetOur SP-ViT-L#219Top 1 Accuracy: 85.5%
image-classification-on-imagenetSP-ViT-S|384#254Top 1 Accuracy: 85.1%
image-classification-on-imagenetOur SP-ViT-M#270Top 1 Accuracy: 84.9%
image-classification-on-imagenetOur SP-ViT-S#367Top 1 Accuracy: 83.9%