CvT: Introducing Convolutions to Vision Transformers

Benchmark Model Rank Results
image-classification-on-cifar-10CvT-W24#6Percentage correct: 99.39
image-classification-on-cifar-100CvT-W24#5Percentage correct: 94.09
image-classification-on-flowers-102CvT-W24#3Accuracy: 99.72
image-classification-on-imagenetCvT-W24 (384 res, ImageNet-22k pretrain)#74Top 1 Accuracy: 87.7%
image-classification-on-imagenetCvT-21 (384 res, ImageNet-22k pretrain)#267Top 1 Accuracy: 84.9%Number of params: 32MGFLOPs: 25
image-classification-on-imagenetCvT-21 (384 res)#426Top 1 Accuracy: 83.3%GFLOPs: 24.9
image-classification-on-imagenetCvT-13 (384 res)#462Top 1 Accuracy: 83%Number of params: 20MGFLOPs: 16.3
image-classification-on-imagenetCvT-21#513Top 1 Accuracy: 82.5%GFLOPs: 7.1
image-classification-on-imagenetCvT-13-NAS#547Top 1 Accuracy: 82.2%Number of params: 18MGFLOPs: 4.1
image-classification-on-imagenetCvT-13#599Top 1 Accuracy: 81.6%GFLOPs: 4.5
image-classification-on-imagenet-realCvT-W24 (384 res, ImageNet-22k pretrain)#14Accuracy: 90.6%Top 1 Accuracy: 87.7%Number of params: 277M
image-classification-on-oxford-iiit-pets-1CvT-W24#2Accuracy: 94.73