| action-classification-on-kinetics-400 | Video-SwinV2-G (ImageNet-22k and external 70M pretrain) | #38 | Acc@1: 86.8 |
| image-classification-on-imagenet | SwinV2-G | #7 | Top 1 Accuracy: 90.17%Number of params: 3000M |
| image-classification-on-imagenet | SwinV2-B | #103 | Top 1 Accuracy: 87.1%Number of params: 88M |
| image-classification-on-imagenet-v2 | SwinV2-G | #4 | Top 1 Accuracy: 84.00% |
| image-classification-on-imagenet-v2 | SwinV2-B | #13 | Top 1 Accuracy: 78.08 |
| instance-segmentation-on-coco | SwinV2-G (HTC++) | #9 | mask AP: 54.4 |
| instance-segmentation-on-coco-minival | SwinV2-G (HTC++) | #8 | mask AP: 53.7 |
| object-detection-on-coco | SwinV2-G (HTC++) | #17 | box mAP: 63.1Params (M): 3000 |
| object-detection-on-coco-minival | SwinV2-G (HTC++) | #16 | box AP: 62.5 |
| semantic-segmentation-on-ade20k | SwinV2-G(UperNet) | #14 | Validation mIoU: 59.9 |
| semantic-segmentation-on-ade20k | SwinV2-G-HTC++ Liu et al. ([2021a]) | #71 | Validation mIoU: 53.7 |