Multi-criteria Token Fusion with One-step-ahead Attention for Efficient Vision Transformers

Benchmark Model Rank Results
efficient-vits-on-imagenet-1k-with-deit-sMCTF ($r=16$)#2Top 1 Accuracy: 80.1GFLOPs: 2.6
efficient-vits-on-imagenet-1k-with-deit-sMCTF ($r=18$)#3Top 1 Accuracy: 79.9GFLOPs: 2.4
efficient-vits-on-imagenet-1k-with-deit-sMCTF ($r=20$)#20Top 1 Accuracy: 79.5GFLOPs: 2.2
efficient-vits-on-imagenet-1k-with-deit-tMCTF ($r=8$)#2Top 1 Accuracy: 72.9GFLOPs: 1.0
efficient-vits-on-imagenet-1k-with-deit-tMCTF ($r=16$)#3Top 1 Accuracy: 72.7GFLOPs: 0.7
efficient-vits-on-imagenet-1k-with-deit-tMCTF ($r=20$)#15Top 1 Accuracy: 71.4GFLOPs: 0.6
efficient-vits-on-imagenet-1k-with-lv-vit-sMCTF ($r=8$)#1Top 1 Accuracy: 83.5GFLOPs: 4.9
efficient-vits-on-imagenet-1k-with-lv-vit-sMCTF ($r=12$)#2Top 1 Accuracy: 83.4GFLOPs: 4.2
efficient-vits-on-imagenet-1k-with-lv-vit-sMCTF ($r=16$)#17Top 1 Accuracy: 82.3GFLOPs: 3.6