| Benchmark | Model | Rank | Results |
|---|---|---|---|
| action-recognition-in-videos-on-kinetics-400-1 | Frozen Backbone, SwinV2-G-ext22K (Video-Swin) | – | Top-1 Accuracy: 81.7 |
| instance-segmentation-on-coco-minival | Frozen Backbone, SwinV2-G-ext22K (HTC) | – | mask AP: 51.6 |
| object-detection-on-coco-minival | Frozen Backbone, SwinV2-G-ext22K (HTC) | – | box AP: 59.3 |
| semantic-segmentation-on-ade20k | Frozen Backbone, SwinV2-G-ext22K (Mask2Former) | – | Validation mIoU: 57.6 |