Max Pooling with Vision Transformers reconciles class and shape in weakly supervised semantic segmentation

Benchmark Model Rank Results
weakly-supervised-semantic-segmentation-onViT-PCM#40Mean IoU: 70.3
weakly-supervised-semantic-segmentation-on-1ViT-PCM#30Mean IoU: 70.9
weakly-supervised-semantic-segmentation-on-14ViT-PCM#4Mean IoU: 71.4
weakly-supervised-semantic-segmentation-on-4ViT-PCM#16mIoU: 45.0