TagAlign: Improving Vision-Language Alignment with Multi-Tag Classification

Benchmark Model Rank Results
open-vocabulary-semantic-segmentation-on-1TaAlign(trained with image-text pairs)#18mIoU: 37.6
open-vocabulary-semantic-segmentation-on-5TagAlign(trained with image-text pairs)#12mIoU: 87.9
unsupervised-semantic-segmentation-with-10TagAlign#6mIoU: 33.3
unsupervised-semantic-segmentation-with-11TagAlign#8mIoU: 53.9
unsupervised-semantic-segmentation-with-3TagAlign#6mIoU: 27.5
unsupervised-semantic-segmentation-with-4TagAlign#6Mean IoU (val): 17.3
unsupervised-semantic-segmentation-with-7TagAlign#4mIoU: 87.9
unsupervised-semantic-segmentation-with-8TagAlign#5mIoU: 37.6
unsupervised-semantic-segmentation-with-9TagAlign#5mIoU: 25.3