A free lunch from ViT:Adaptive Attention Multi-scale Fusion Transformer for Fine-grained Visual Recognition

Benchmark Model Rank Results
fine-grained-image-classification-on-stanford-carsAFTrans–Accuracy: 95.0%
fine-grained-image-classification-on-stanford-dogsAFTrans–Accuracy: 91.6%