EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction

Benchmark Model Rank Results
image-classification-on-imagenetEfficientViT-L2 (r384)#176Top 1 Accuracy: 86%Number of params: 64MGFLOPs: 20
image-classification-on-imagenetEfficientViT-L2 (r288)#210Top 1 Accuracy: 85.6%Number of params: 64MGFLOPs: 11
image-classification-on-imagenetEfficientViT-L1 (r224)#302Top 1 Accuracy: 84.5%Number of params: 53MGFLOPs: 5.3
image-classification-on-imagenetEfficientViT-B3 (r288)#329Top 1 Accuracy: 84.2%Number of params: 49MGFLOPs: 6.5
image-classification-on-imagenetEfficientViT-B3 (r224)#410Top 1 Accuracy: 83.5%GFLOPs: 4
image-classification-on-imagenetEfficientViT-B2 (r256)#497Top 1 Accuracy: 82.7%Number of params: 24MGFLOPs: 2.1
semantic-segmentation-on-ade20kEfficientViT-B3 (r512)#138Validation mIoU: 49
semantic-segmentation-on-cityscapes-valEfficientViT-B3 (r1184x2368)#25mIoU: 83.2