An Efficient Post-hoc Framework for Reducing Task Discrepancy of Text Encoders for Composed Image Retrieval

Benchmark Model Rank Results
zero-shot-composed-image-retrieval-zs-cir-on-circoRTD + LinCIR (CLIP G/14)#18mAP@10: 22.29
zero-shot-composed-image-retrieval-zs-cir-on-circoRTD + LinCIR (CLIP L/14)#25mAP@10: 18.11
zero-shot-composed-image-retrieval-zs-cir-on-cirrRTD + LinCIR (CLIP G/14)#20R@5: 67.47
zero-shot-composed-image-retrieval-zs-cir-on-cirrRTD + LinCIR (CLIP L/14)#30R@5: 56.17
zero-shot-composed-image-retrieval-zs-cir-on-fashion-iqRTD + LinCIR (CLIP G/14)#1(Recall@10+Recall@50)/2: 56.74
zero-shot-composed-image-retrieval-zs-cir-on-fashion-iqRTD + LinCIR (CLIP L/14)#22(Recall@10+Recall@50)/2: 40.66