From Text to Mask: Localizing Entities Using the Attention of Text-to-Image Diffusion Models

Benchmark Model Rank Results
weakly-supervised-semantic-segmentation-onT2MDiffusion(DeepLabV2-ResNet101)#16Mean IoU: 73.3
weakly-supervised-semantic-segmentation-on-1T2MDiffusion(DeepLabV2-ResNet101)#11Mean IoU: 74.2
weakly-supervised-semantic-segmentation-on-4T2MDiffusion(DeepLabV2-ResNet101)#11mIoU: 45.7