Learned Thresholds Token Merging and Pruning for Vision Transformers

Benchmark Model Rank Results
efficient-vits-on-imagenet-1k-with-deit-sLTMP (80%)#11Top 1 Accuracy: 79.8GFLOPs: 3.8
efficient-vits-on-imagenet-1k-with-deit-sLTMP (60%)#18Top 1 Accuracy: 79.6GFLOPs: 3.0
efficient-vits-on-imagenet-1k-with-deit-sLTMP (45%)#33Top 1 Accuracy: 78.6GFLOPs: 2.3
efficient-vits-on-imagenet-1k-with-deit-tLTMP (80%)#11Top 1 Accuracy: 72.0GFLOPs: 1.0
efficient-vits-on-imagenet-1k-with-deit-tLTMP (60%)#13Top 1 Accuracy: 71.5GFLOPs: 0.8
efficient-vits-on-imagenet-1k-with-deit-tLTMP (45%)#19Top 1 Accuracy: 69.8GFLOPs: 0.7