Beyond Attentive Tokens: Incorporating Token Importance and Diversity for Efficient Vision Transformers

Benchmark Model Rank Results
efficient-vits-on-imagenet-1k-with-deit-sBAT (70%)#17Top 1 Accuracy: 79.6GFLOPs: 3.0
efficient-vits-on-imagenet-1k-with-deit-sBAT (60%)#25Top 1 Accuracy: 79.3GFLOPs: 2.6
efficient-vits-on-imagenet-1k-with-deit-sBAT (50%)#28Top 1 Accuracy: 79.0GFLOPs: 2.3
efficient-vits-on-imagenet-1k-with-deit-sBAT (40%)#32Top 1 Accuracy: 78.6GFLOPs: 2.0
efficient-vits-on-imagenet-1k-with-deit-sBAT (30%)#37Top 1 Accuracy: 77.8GFLOPs: 1.8
efficient-vits-on-imagenet-1k-with-deit-sBAT (20%)#38Top 1 Accuracy: 76.4GFLOPs: 1.6
efficient-vits-on-imagenet-1k-with-deit-tBAT#4Top 1 Accuracy: 72.3GFLOPs: 0.8
efficient-vits-on-imagenet-1k-with-lv-vit-sBAT#8Top 1 Accuracy: 83.1GFLOPs: 4.7