A Simple Long-Tailed Recognition Baseline via Vision-Language Model

Benchmark Model Rank Results
long-tail-learning-on-cifar-100-lt-r-100BALLAD (ViT-B/16)#5Error Rate: 22.2
long-tail-learning-on-imagenet-ltBALLAD(ResNet-50×16)#5Top-1 Accuracy: 76.5
long-tail-learning-on-imagenet-ltBALLAD(ViT-B-16)#6Top-1 Accuracy: 75.7
long-tail-learning-on-imagenet-ltBALLAD(ResNet-101)#7Top-1 Accuracy: 70.5
long-tail-learning-on-imagenet-ltBALLAD(ResNet-50)#9Top-1 Accuracy: 67.2
long-tail-learning-on-places-ltBALLAD(ViT-B-16)#4Top-1 Accuracy: 49.5
long-tail-learning-on-places-ltBALLAD(ResNet-50×16)#5Top-1 Accuracy: 49.3
long-tail-learning-on-places-ltBALLAD(ResNet-101)#7Top-1 Accuracy: 47.9
long-tail-learning-on-places-ltBALLAD(ResNet-50)#8Top-1 Accuracy: 46.5