FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization

Benchmark Model Rank Results
3d-hand-pose-estimation-on-freihandFastViT-MA36#13PA-MPJPE: 6.6PA-MPVPE: 6.7PA-F@5mm: 0.722PA-F@15mm: 0.981
image-classification-on-imagenetFastViT-MA36#272Top 1 Accuracy: 84.9%
image-classification-on-imagenetFastViT-SA36#306Top 1 Accuracy: 84.5%
image-classification-on-imagenetFastViT-SA24#508Top 1 Accuracy: 82.6%
image-classification-on-imagenetFastViT-SA12#661Top 1 Accuracy: 80.6%
image-classification-on-imagenetFastViT-S12#701Top 1 Accuracy: 79.8%
image-classification-on-imagenetFastViT-T12#739Top 1 Accuracy: 79.1%
image-classification-on-imagenetFastViT-T8#884Top 1 Accuracy: 75.6%
semantic-segmentation-on-ade20kFastViT-MA36#223Mean IoU (class): 44.6
semantic-segmentation-on-ade20kFastViT-SA36#224Mean IoU (class): 42.9
semantic-segmentation-on-ade20kFastViT-SA24#225Mean IoU (class): 41
semantic-segmentation-on-ade20kFastViT-SA12#226Mean IoU (class): 38