ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias

Benchmark Model Rank Results
image-classification-on-imagenetViTAE-B-Stage#401Top 1 Accuracy: 83.6%Number of params: 48.5MGFLOPs: 27.6
image-classification-on-imagenetViTAE-S-Stage#550Top 1 Accuracy: 82.2%Number of params: 19.2MGFLOPs: 12.0
image-classification-on-imagenetViTAE-13M#642Top 1 Accuracy: 81%Number of params: 13.2MGFLOPs: 6.8
image-classification-on-imagenetViTAE-6M#809Top 1 Accuracy: 77.9%Number of params: 6.5MGFLOPs: 4
image-classification-on-imagenetViTAE-T-Stage#842Top 1 Accuracy: 76.8%Number of params: 4.8MGFLOPs: 4.6
image-classification-on-imagenetViTAE-T#893Top 1 Accuracy: 75.3%GFLOPs: 3.0
video-object-segmentation-on-davis-2016ViTAE-T-Stage#3J&F: 89.8F-Score: 90.4Jaccard (Mean): 89.2
video-object-segmentation-on-davis-2017ViTAE-T-Stage#1Jaccard (Mean): 79.4J&F: 82.5F-Score: 85.5