Rethinking Semantic Segmentation from a Sequence-to-Sequence Perspective with Transformers

Benchmark Model Rank Results
medical-image-segmentation-on-synapse-multiSETR#20Avg DSC: 79.60
semantic-segmentation-on-ade20kSETR-MLA (160k, MS)#113Validation mIoU: 50.28
semantic-segmentation-on-cityscapesSETR-PUP++#33Mean IoU (class): 81.64%
semantic-segmentation-on-cityscapes-valSETR-PUP (80k, MS)#34mIoU: 82.15
semantic-segmentation-on-dada-segSETR (PUP, Transformer-Large)#4mIoU: 31.8
semantic-segmentation-on-dada-segSETR (MLA, Transformer-Large)#5mIoU: 30.4
semantic-segmentation-on-densepassSETR (PUP, Transformer-L)#18mIoU: 35.7%
semantic-segmentation-on-densepassSETR (MLA, Transformer-L)#19mIoU: 35.6%
semantic-segmentation-on-foodseg103SeTR-MLA (ViT-16/B)#2mIoU: 45.1
semantic-segmentation-on-foodseg103SeTR-Naive (ViT-16/B)#5mIoU: 41.3
semantic-segmentation-on-pascal-contextSETR-MLA (16, 80k, MS)#23mIoU: 55.83
semantic-segmentation-on-urbanlfSETR (ViT-Large)#9mIoU (Syn): 77.69mIoU (Real): 77.74