CAS-ViT: Convolutional Additive Self-attention Vision Transformers for Efficient Mobile Applications

Benchmark Model Rank Results
image-classification-on-imagenetCAS-ViT-T#348Top 1 Accuracy: 84.1%Number of params: 21.76MGFLOPs: 3.597
image-classification-on-imagenetCAS-ViT-M#467Top 1 Accuracy: 83.0%Number of params: 12.42MGFLOPs: 1.887
image-classification-on-imagenetCAS-ViT-S#639Top 1 Accuracy: 81.1%Number of params: 5.76MGFLOPs: 0.932
image-classification-on-imagenetCAS-ViT-XS#768Top 1 Accuracy: 78.7%Number of params: 3.2MGFLOPs: 0.56