LocalViT: Bringing Locality to Vision Transformers

Benchmark Model Rank Results
image-classification-on-imagenetLocalViT-S#651Top 1 Accuracy: 80.8%Number of params: 22.4MGFLOPs: 4.6
image-classification-on-imagenetLocalViT-PVT#796Top 1 Accuracy: 78.2%Number of params: 13.5MGFLOPs: 4.8
image-classification-on-imagenetLocalViT-TNT#870Top 1 Accuracy: 75.9%Number of params: 6.3MGFLOPs: 1.4
image-classification-on-imagenetLocalViT-T#906Top 1 Accuracy: 74.8%Number of params: 5.9MGFLOPs: 1.3
image-classification-on-imagenetLocalViT-T2T#934Top 1 Accuracy: 72.5%Number of params: 4.3MGFLOPs: 1.2