ViT-NeT: Interpretable Vision Transformers with Neural Tree Decoder

Benchmark Model Rank Results
fine-grained-image-classification-on-cub-200-1ViT-NeT#6Accuracy: 91.7
fine-grained-image-classification-on-nabirdsViT-NeT (SwinV2-B)#4Accuracy: 92.5%
fine-grained-image-classification-on-stanfordViT-NeT (SwinV2-B)#19Accuracy: 95.0%
fine-grained-image-classification-on-stanford-1ViT-NeT (DeiT-III-B)#3Accuracy: 93.6%
image-classification-on-inaturalistViT-NeT (SwinV2-B)#6Top 1 Accuracy: 81.2