Joint Token Pruning and Squeezing Towards More Aggressive Compression of Vision Transformers

Benchmark Model Rank Results
efficient-vits-on-imagenet-1k-with-deit-sdTPS#1Top 1 Accuracy: 80.1GFLOPs: 3.0
efficient-vits-on-imagenet-1k-with-deit-seTPS#15Top 1 Accuracy: 79.7GFLOPs: 3.0
efficient-vits-on-imagenet-1k-with-deit-tdTPS#1Top 1 Accuracy: 72.9GFLOPs: 0.8
efficient-vits-on-imagenet-1k-with-deit-teTPS#5Top 1 Accuracy: 72.3GFLOPs: 0.8
efficient-vits-on-imagenet-1k-with-lv-vit-sdTPS#13Top 1 Accuracy: 82.6GFLOPs: 3.8
efficient-vits-on-imagenet-1k-with-lv-vit-seTPS#16Top 1 Accuracy: 82.5GFLOPs: 3.8