Three things everyone should know about Vision Transformers

Benchmark Model Rank Results
fine-grained-image-classification-on-stanfordViT-L (attn finetune)#46Accuracy: 93.8%
image-classification-on-cifar-10ViT-B (attn fine-tune)#10Percentage correct: 99.3
image-classification-on-cifar-100ViT-L (attn fine-tune)#11Percentage correct: 93.0
image-classification-on-flowers-102ViT-B (attn finetune)#22Accuracy: 98.5
image-classification-on-imagenetViT-L@384 (attn finetune)#217Top 1 Accuracy: 85.5%
image-classification-on-imagenetViT-B@384 (attn finetune)#320Top 1 Accuracy: 84.3%
image-classification-on-imagenetViT-B-36x1#342Top 1 Accuracy: 84.1%
image-classification-on-imagenetViT-B-18x2#343Top 1 Accuracy: 84.1%
image-classification-on-imagenetViT-B (hMLP + BeiT)#416Top 1 Accuracy: 83.4%
image-classification-on-imagenetViT-S-24x2#507Top 1 Accuracy: 82.6%
image-classification-on-imagenetViT-S-48x1#536Top 1 Accuracy: 82.3%
image-classification-on-imagenet-v2ViT-B-36x1#19Top 1 Accuracy: 73.9
image-classification-on-inaturalist-2018ViT-L (attn finetune)#24Top-1 Accuracy: 75.3%