| instance-segmentation-on-coco | ViT-Adapter-L (HTC++, BEiTv2, O365, multi-scale) | #7 | mask AP: 54.5 |
| instance-segmentation-on-coco | ViT-Adapter-L (HTC++, BEiTv2 pretrain, multi-scale) | #12 | mask AP: 53.0 |
| instance-segmentation-on-coco | ViT-Adapter-L (HTC++, BEiT pretrain, multi-scale) | #14 | mask AP: 52.5 |
| instance-segmentation-on-coco-minival | ViT-Adapter-L (HTC++, BEiTv2, O365, multi-scale) | #6 | mask AP: 54.2 |
| instance-segmentation-on-coco-minival | ViT-Adapter-L (HTC++, BEiTv2 pretrain, multi-scale) | #13 | mask AP: 52.5 |
| instance-segmentation-on-coco-minival | ViT-Adapter-L (HTC++, BEiT pretrain, multi-scale) | #14 | mask AP: 52.2 |
| object-detection-on-coco | ViT-Adapter-L (HTC++, BEiTv2 pretrain, multi-scale) | #24 | box mAP: 60.9 |
| object-detection-on-coco | ViT-Adapter-L (HTC++, BEiT pretrain, multi-scale) | #27 | box mAP: 60.4 |
| object-detection-on-coco-minival | ViT-Adapter-L (HTC++, BEiTv2 pretrain, multi-scale) | #23 | box AP: 60.5 |
| object-detection-on-coco-minival | ViT-Adapter-L (HTC++, BEiT pretrain, multi-scale) | #27 | box AP: 60.2 |
| object-detection-on-coco-o | ViT-Adapter (BEiTv2-L) | #11 | Average mAP: 34.25Effective Robustness: 7.79 |
| panoptic-segmentation-on-coco-minival | ViT-Adapter-L (single-scale, BEiTv2 pretrain, Mask2Former) | #9 | PQ: 58.4PQst: 48.4PQth: 65.0AP: 48.9 |
| semantic-segmentation-on-ade20k | ViT-Adapter-L (Mask2Former, BEiTv2 pretrain) | #8 | Validation mIoU: 61.5Params (M): 571 |
| semantic-segmentation-on-ade20k | ViT-Adapter-L (Mask2Former, BEiT pretrain) | #12 | Validation mIoU: 60.5Params (M): 571 |
| semantic-segmentation-on-ade20k | ViT-Adapter-L (UperNet, BEiT pretrain) | #19 | Validation mIoU: 58.4Params (M): 451 |
| semantic-segmentation-on-ade20k-val | ViT-Adapter-L (Mask2Former, BEiT pretrain) | #7 | mIoU: 60.5 |
| semantic-segmentation-on-ade20k-val | ViT-Adapter-L (UperNet, BEiT pretrain) | #10 | mIoU: 58.4 |
| semantic-segmentation-on-cityscapes | ViT-Adapter-L (Mask2Former, BEiT pretrain) | #5 | Mean IoU (class): 85.2% |
| semantic-segmentation-on-cityscapes-val | ViT-Adapter-L | #9 | mIoU: 85.8 |
| semantic-segmentation-on-pascal-context | ViT-Adapter-L (Mask2Former, BEiT pretrain) | #3 | mIoU: 68.2 |
| semantic-segmentation-on-pascal-context | ViT-Adapter-L (UperNet, BEiT pretrain) | #4 | mIoU: 67.5 |