Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision

Benchmark Model Rank Results
cross-modal-retrieval-on-coco-2014ALIGN#14Text-to-image R@1: 59.9Text-to-image R@5: 83.3
cross-modal-retrieval-on-flickr30kALIGN#7Image-to-text R@1: 95.3Image-to-text R@5: 99.8Image-to-text R@10: 100
fine-grained-image-classification-on-food-101ALIGN#3Accuracy: 95.88
fine-grained-image-classification-on-oxford-1ALIGN#3Accuracy: 96.19%
fine-grained-image-classification-on-stanfordALIGN#5Accuracy: 96.13%
image-classification-on-flowers-102ALIGN#7Accuracy: 99.65%
image-classification-on-imagenetALIGN (EfficientNet-L2)#33Top 1 Accuracy: 88.64%Number of params: 480M
image-classification-on-vtab-1k-1ALIGN (50 hypers/task)#1Top-1 Accuracy: 79.99
zero-shot-cross-modal-retrieval-on-coco-2014ALIGN#14Image-to-text R@1: 58.6Image-to-text R@5: 83.0
zero-shot-cross-modal-retrieval-on-flickr30kALIGN#14Image-to-text R@1: 88.6Image-to-text R@5: 98.7
zero-shot-transfer-image-classification-on-1ALIGN#12Accuracy (Private): 76.4
zero-shot-transfer-image-classification-on-3ALIGN#8Accuracy (Private): 70.1
zero-shot-transfer-image-classification-on-4ALIGN#7Accuracy: 92.2
zero-shot-transfer-image-classification-on-5ALIGN#9Accuracy (Private): 75.8