Scalable Vision Transformers with Hierarchical Pooling

Benchmark Model Rank Results
efficient-vits-on-imagenet-1k-with-deit-sHVT-S-1#35Top 1 Accuracy: 78.3GFLOPs: 2.7
efficient-vits-on-imagenet-1k-with-deit-tHVT-Ti-1#20Top 1 Accuracy: 69.6GFLOPs: 0.6
image-classification-on-imagenetHVT-S-1#807Top 1 Accuracy: 78.00%Number of params: 21.74MGFLOPs: 2.4
image-classification-on-imagenetHVT-Ti-1#961Top 1 Accuracy: 69.64%Number of params: 5.74MGFLOPs: 0.64