CSWin Transformer: A General Vision Transformer Backbone with Cross-Shaped Windows

Benchmark Model Rank Results
image-classification-on-imagenetCSWin-L (384 res,ImageNet-22k pretrain)#80Top 1 Accuracy: 87.5%Number of params: 173MGFLOPs: 96.8
semantic-segmentation-on-ade20kCSWin-L (UperNet, ImageNet-22k pretrain)#43Validation mIoU: 55.70
semantic-segmentation-on-ade20k-valCSWin-L (UperNet, ImageNet-22k pretrain)#26mIoU: 55.7