Tokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNet

Benchmark Model Rank Results
image-classification-on-imagenetT2T-ViT-14|384#424Top 1 Accuracy: 83.3%GFLOPs: 34.2
image-classification-on-imagenetT2T-ViTt-24#506Top 1 Accuracy: 82.6%Number of params: 64.4MGFLOPs: 30
image-classification-on-imagenetT2T-ViT-24#532Top 1 Accuracy: 82.3%GFLOPs: 27.6
image-classification-on-imagenetT2T-ViTt-19#543Top 1 Accuracy: 82.2%Number of params: 39.2MGFLOPs: 19.6
image-classification-on-imagenetT2T-ViT-19#572Top 1 Accuracy: 81.9%GFLOPs: 17.0
image-classification-on-imagenetT2T-ViT-14#607Top 1 Accuracy: 81.5%Number of params: 21.5MGFLOPs: 9.6