CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification

Benchmark Model Rank Results
image-classification-on-imagenetCrossViT-18+#479Top 1 Accuracy: 82.8%Number of params: 44.3MGFLOPs: 9.5
image-classification-on-imagenetCrossViT-18#512Top 1 Accuracy: 82.5%Number of params: 43.3MGFLOPs: 9
image-classification-on-imagenetCrossViT-15+#533Top 1 Accuracy: 82.3%Number of params: 28.2MGFLOPs: 6.1
image-classification-on-imagenetCrossViT-15#608Top 1 Accuracy: 81.5%Number of params: 27.4MGFLOPs: 5.8