Twins: Revisiting the Design of Spatial Attention in Vision Transformers

Benchmark Model Rank Results
image-classification-on-imagenetTwins-SVT-L#381Top 1 Accuracy: 83.7%Number of params: 99.2MGFLOPs: 15.1
semantic-segmentation-on-ade20kTwins-SVT-L (UperNet, ImageNet-1k pretrain)#114Validation mIoU: 50.2
semantic-segmentation-on-ade20k-valTwins-SVT-L (UperNet, ImageNet-1k pretrain)#51mIoU: 50.2