Rethinking Spatial Dimensions of Vision Transformers

Benchmark Model Rank Results
image-classification-on-imagenetPiT-B#355Top 1 Accuracy: 84%Number of params: 73.8MGFLOPs: 12.5
image-classification-on-imagenetPiT-S#574Top 1 Accuracy: 81.9%Number of params: 23.5MGFLOPs: 2.9
image-classification-on-imagenetPiT-XS#736Top 1 Accuracy: 79.1%Number of params: 10.6MGFLOPs: 1.4
image-classification-on-imagenetPiT-Ti#914Top 1 Accuracy: 74.6%Number of params: 4.9MGFLOPs: 0.7