A free lunch from ViT:Adaptive Attention Multi-scale Fusion Transformer for Fine-grained Visual Recognition
Open paper
Benchmark
Model
Rank
Results
fine-grained-image-classification-on-stanford-cars
AFTrans
–
Accuracy: 95.0%
fine-grained-image-classification-on-stanford-dogs
AFTrans
–
Accuracy: 91.6%
Rank counts only results with a code link.