Masked-attention Mask Transformer for Universal Image Segmentation

Benchmark Model Rank Results
2d-semantic-segmentation-on-wildscenesMask2Former (Swin-L)#1mIoU: 47.85
2d-semantic-segmentation-on-wildscenesMask2Former (ResNet-50)#3mIoU: 43.71
instance-segmentation-on-ade20k-valMask2Former (Swin-L, single-scale)#11AP: 34.9APL: 54.7APM: 40APS: 16.3
instance-segmentation-on-ade20k-valMask2Former (Swin-L + FAPN)#12AP: 33.4APL: 54.6APM: 37.6APS: 14.6
instance-segmentation-on-ade20k-valMask2Former (ResNet50)#13AP: 26.4APS: 10.4
instance-segmentation-on-ade20k-valMask2Former (ResNet-50)#14APL: 43.1APM: 28.9
instance-segmentation-on-cityscapes-valMask2Former (Swin-L, single-scale)#9mask AP: 43.7
instance-segmentation-on-cityscapes-valMask2Former (Swin-B)#10mask AP: 42
instance-segmentation-on-cityscapes-valMask2Former (Swin-S)#11mask AP: 41.8
instance-segmentation-on-cityscapes-valMask2Former (Swin-T)#13mask AP: 39.7
instance-segmentation-on-cityscapes-valMask2Former (ResNet-101)#14mask AP: 38.5
instance-segmentation-on-cityscapes-valMask2Former (ResNet-50)#15mask AP: 37.4
instance-segmentation-on-cocoMask2Former (Swin-L, single scale)#20mask AP: 50.5AP50: 74.9AP75: 54.9APS: 29.1APM: 53.8APL: 71.2
instance-segmentation-on-coco-minivalMask2Former (Swin-L)#24mask AP: 50.1
instance-segmentation-on-coco-val-panopticMask2Former (Swin-L, single-scale)#3AP: 49.1
panoptic-segmentation-on-ade20k-valMask2Former (Swin-L)#18PQ: 48.1mIoU: 54.5AP: 34.2
panoptic-segmentation-on-ade20k-valMask2Former (Swin-L + FAPN, 640x640)#19PQ: 46.2mIoU: 55.4AP: 33.2
panoptic-segmentation-on-ade20k-valMask2Former (ResNet-50, 640x640)#22PQ: 39.7
panoptic-segmentation-on-ade20k-valPanoptic-DeepLab (SwideRNet)#23PQ: 37.9mIoU: 50
panoptic-segmentation-on-ade20k-valMask2Former (ResNet-50, 640x640)#25mIoU: 46.1AP: 26.5
panoptic-segmentation-on-cityscapes-valMask2Former (Swin-L)#13PQ: 66.6mIoU: 82.9AP: 43.6
panoptic-segmentation-on-coco-minivalMask2Former (single-scale)#18PQ: 57.8PQst: 48.1PQth: 64.2AP: 48.6
panoptic-segmentation-on-coco-test-devMask2Former (Swin-L)#3PQ: 58.3PQst: 48.1PQth: 65.1
semantic-segmentation-on-ade20kMask2Former (SwinL-FaPN)#26Validation mIoU: 57.7
semantic-segmentation-on-ade20kMask2Former (SwinL)#31Validation mIoU: 57.3
semantic-segmentation-on-ade20kMask2Former (Swin-L-FaPN)#38Validation mIoU: 56.4
semantic-segmentation-on-ade20kMask2Former(Swin-B)#48Validation mIoU: 55.1
semantic-segmentation-on-ade20k-valMask2Former (Swin-L-FaPN, multiscale)#17mIoU: 57.7
semantic-segmentation-on-ade20k-valMask2Former (Swin-L-FaPN)#24mIoU: 56.4
semantic-segmentation-on-cityscapes-valMask2Former (Swin-L)#17mIoU: 84.3
semantic-segmentation-on-coco-1Mask2Former (Swin-L, single-scale)#6mIoU: 67.4
semantic-segmentation-on-coco-1MaskFormer (Swin-L, single-scale)#8mIoU: 64.8
semantic-segmentation-on-fine-grained-grassMask2Former#10mIoU: 44.93
semantic-segmentation-on-mapillary-valMask2Former (Swin-L, multiscale)#3mIoU: 64.7