ConViT: Improving Vision Transformers with Soft Convolutional Inductive Biases

Benchmark Model Rank Results
image-classification-on-imagenetConViT-B+#511Top 1 Accuracy: 82.5%Number of params: 152MGFLOPs: 30
image-classification-on-imagenetConViT-B#520Top 1 Accuracy: 82.4%Number of params: 86MGFLOPs: 17
image-classification-on-imagenetConViT-S+#544Top 1 Accuracy: 82.2%Number of params: 48MGFLOPs: 10
image-classification-on-imagenetConViT-S#624Top 1 Accuracy: 81.3%Number of params: 27MGFLOPs: 5.4
image-classification-on-imagenetConViT-Ti+#846Top 1 Accuracy: 76.7%Number of params: 10MGFLOPs: 2
image-classification-on-imagenetConViT-Ti#928Top 1 Accuracy: 73.1%Number of params: 6MGFLOPs: 1