Swin Transformer V2: Scaling Up Capacity and Resolution

Benchmark Model Rank Results
action-classification-on-kinetics-400Video-SwinV2-G (ImageNet-22k and external 70M pretrain)#38Acc@1: 86.8
image-classification-on-imagenetSwinV2-G#7Top 1 Accuracy: 90.17%Number of params: 3000M
image-classification-on-imagenetSwinV2-B#103Top 1 Accuracy: 87.1%Number of params: 88M
image-classification-on-imagenet-v2SwinV2-G#4Top 1 Accuracy: 84.00%
image-classification-on-imagenet-v2SwinV2-B#13Top 1 Accuracy: 78.08
instance-segmentation-on-cocoSwinV2-G (HTC++)#9mask AP: 54.4
instance-segmentation-on-coco-minivalSwinV2-G (HTC++)#8mask AP: 53.7
object-detection-on-cocoSwinV2-G (HTC++)#17box mAP: 63.1Params (M): 3000
object-detection-on-coco-minivalSwinV2-G (HTC++)#16box AP: 62.5
semantic-segmentation-on-ade20kSwinV2-G(UperNet)#14Validation mIoU: 59.9
semantic-segmentation-on-ade20kSwinV2-G-HTC++ Liu et al. ([2021a])#71Validation mIoU: 53.7