AltCLIP: Altering the Language Encoder in CLIP for Extended Language Capabilities

Benchmark Model Rank Results
zero-shot-cross-modal-retrieval-on-flickr30kAltCLIP#17Image-to-text R@1: 86Image-to-text R@5: 98Image-to-text R@10: 99.1
zero-shot-transfer-image-classification-on-1AltCLIP#14Accuracy (Private): 74.5
zero-shot-transfer-image-classification-on-3AltCLIP#10Accuracy (Private): 68.1
zero-shot-transfer-image-classification-on-4AltCLIP#9Accuracy: 87.2
zero-shot-transfer-image-classification-on-5AltCLIP#10Accuracy (Private): 69.5
zero-shot-transfer-image-classification-on-8AltCLIP#5Accuracy (Private): 58.7