| open-vocabulary-semantic-segmentation-on-1 | TaAlign(trained with image-text pairs) | #18 | mIoU: 37.6 |
| open-vocabulary-semantic-segmentation-on-5 | TagAlign(trained with image-text pairs) | #12 | mIoU: 87.9 |
| unsupervised-semantic-segmentation-with-10 | TagAlign | #6 | mIoU: 33.3 |
| unsupervised-semantic-segmentation-with-11 | TagAlign | #8 | mIoU: 53.9 |
| unsupervised-semantic-segmentation-with-3 | TagAlign | #6 | mIoU: 27.5 |
| unsupervised-semantic-segmentation-with-4 | TagAlign | #6 | Mean IoU (val): 17.3 |
| unsupervised-semantic-segmentation-with-7 | TagAlign | #4 | mIoU: 87.9 |
| unsupervised-semantic-segmentation-with-8 | TagAlign | #5 | mIoU: 37.6 |
| unsupervised-semantic-segmentation-with-9 | TagAlign | #5 | mIoU: 25.3 |