ViTAEv2: Vision Transformer Advanced by Exploring Inductive Bias for Image Recognition and Beyond

Benchmark Model Rank Results
image-classification-on-imagenetViTAE-H + MAE (448)#42Top 1 Accuracy: 88.5%Number of params: 644M
image-classification-on-imagenet-realViTAE-H (MAE, 512)#2Accuracy: 91.2%Params: 644M