Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers

Benchmark Model Rank Results
image-classification-on-imagenetCaiT-S24#266Top 1 Accuracy: 84.91%
image-classification-on-imagenetXCiT-S#392Top 1 Accuracy: 83.65%
image-classification-on-imagenetWave-ViT-S#394Top 1 Accuracy: 83.61%
image-classification-on-imagenetSwinV2-Ti#457Top 1 Accuracy: 83.09%
image-classification-on-imagenetViT-S#509Top 1 Accuracy: 82.54%
image-classification-on-imagenetEViT (delete)#539Top 1 Accuracy: 82.29%
image-classification-on-imagenetSTViT-Swin-Ti#540Top 1 Accuracy: 82.22%
image-classification-on-imagenetToMe-ViT-S#555Top 1 Accuracy: 82.11%
image-classification-on-imagenetEViT (fuse)#571Top 1 Accuracy: 81.96%
image-classification-on-imagenetGFNet-S#622Top 1 Accuracy: 81.33%
image-classification-on-imagenetDynamicViT-S#640Top 1 Accuracy: 81.09%
image-classification-on-imagenetTokenLearner-ViT-8#657Top 1 Accuracy: 80.66%
image-classification-on-imagenetCoaT-Ti#786Top 1 Accuracy: 78.42%
image-classification-on-imagenetPoly-SA-ViT-S#792Top 1 Accuracy: 78.34%
image-classification-on-imagenetEfficientFormer-V2-S0#946Top 1 Accuracy: 71.53%