Rethinking Local Perception in Lightweight Vision Transformer

Benchmark Model Rank Results
image-classification-on-imagenetCloFormer-S#604Top 1 Accuracy: 81.6%Number of params: 12.3MGFLOPs: 2
image-classification-on-imagenetCloFormer-XS#702Top 1 Accuracy: 79.8%Number of params: 7.2MGFLOPs: 1.1
image-classification-on-imagenetCloFormer-XXS#836Top 1 Accuracy: 77%Number of params: 4.2MGFLOPs: 0.6