A Closer Look at the Explainability of Contrastive Language-Image Pre-training

Benchmark Model Rank Results
open-vocabulary-semantic-segmentation-on-cityscapesCLIP Surgery (CLIP without any fine-tuning)#4mIoU: 31.4
open-vocabulary-semantic-segmentation-on-coco-stuff-171CLIP Surgery (original CLIP without any fine-tuning)#6mIoU: 21.9
open-vocabulary-semantic-segmentation-on-pascal-context-59CLIP Surgery (original CLIP without any fine-tuning)#23mIoU: 29.3
zero-shot-segmentation-on-ade20k-training-freeCLIPSurgery#4mIoU: 12.9