Vision Transformer Adapter for Dense Predictions

Benchmark Model Rank Results
instance-segmentation-on-cocoViT-Adapter-L (HTC++, BEiTv2, O365, multi-scale)#7mask AP: 54.5
instance-segmentation-on-cocoViT-Adapter-L (HTC++, BEiTv2 pretrain, multi-scale)#12mask AP: 53.0
instance-segmentation-on-cocoViT-Adapter-L (HTC++, BEiT pretrain, multi-scale)#14mask AP: 52.5
instance-segmentation-on-coco-minivalViT-Adapter-L (HTC++, BEiTv2, O365, multi-scale)#6mask AP: 54.2
instance-segmentation-on-coco-minivalViT-Adapter-L (HTC++, BEiTv2 pretrain, multi-scale)#13mask AP: 52.5
instance-segmentation-on-coco-minivalViT-Adapter-L (HTC++, BEiT pretrain, multi-scale)#14mask AP: 52.2
object-detection-on-cocoViT-Adapter-L (HTC++, BEiTv2 pretrain, multi-scale)#24box mAP: 60.9
object-detection-on-cocoViT-Adapter-L (HTC++, BEiT pretrain, multi-scale)#27box mAP: 60.4
object-detection-on-coco-minivalViT-Adapter-L (HTC++, BEiTv2 pretrain, multi-scale)#23box AP: 60.5
object-detection-on-coco-minivalViT-Adapter-L (HTC++, BEiT pretrain, multi-scale)#27box AP: 60.2
object-detection-on-coco-oViT-Adapter (BEiTv2-L)#11Average mAP: 34.25Effective Robustness: 7.79
panoptic-segmentation-on-coco-minivalViT-Adapter-L (single-scale, BEiTv2 pretrain, Mask2Former)#9PQ: 58.4PQst: 48.4PQth: 65.0AP: 48.9
semantic-segmentation-on-ade20kViT-Adapter-L (Mask2Former, BEiTv2 pretrain)#8Validation mIoU: 61.5Params (M): 571
semantic-segmentation-on-ade20kViT-Adapter-L (Mask2Former, BEiT pretrain)#12Validation mIoU: 60.5Params (M): 571
semantic-segmentation-on-ade20kViT-Adapter-L (UperNet, BEiT pretrain)#19Validation mIoU: 58.4Params (M): 451
semantic-segmentation-on-ade20k-valViT-Adapter-L (Mask2Former, BEiT pretrain)#7mIoU: 60.5
semantic-segmentation-on-ade20k-valViT-Adapter-L (UperNet, BEiT pretrain)#10mIoU: 58.4
semantic-segmentation-on-cityscapesViT-Adapter-L (Mask2Former, BEiT pretrain)#5Mean IoU (class): 85.2%
semantic-segmentation-on-cityscapes-valViT-Adapter-L#9mIoU: 85.8
semantic-segmentation-on-pascal-contextViT-Adapter-L (Mask2Former, BEiT pretrain)#3mIoU: 68.2
semantic-segmentation-on-pascal-contextViT-Adapter-L (UperNet, BEiT pretrain)#4mIoU: 67.5