When Shift Operation Meets Vision Transformer: An Extremely Simple Alternative to Attention Mechanism

Benchmark Model Rank Results
image-classification-on-imagenetShift-B#431Top 1 Accuracy: 83.3%Number of params: 88MGFLOPs: 15.2
image-classification-on-imagenetShift-S#482Top 1 Accuracy: 82.8%Number of params: 50MGFLOPs: 8.5
image-classification-on-imagenetShift-T#596Top 1 Accuracy: 81.7%Number of params: 28MGFLOPs: 4.4
object-detection-on-coco-minivalShift-T#218APM: 42.3
semantic-segmentation-on-ade20kShift-B (UperNet)#133Validation mIoU: 49.2
semantic-segmentation-on-ade20kShift-B#153Validation mIoU: 47.9
semantic-segmentation-on-ade20kShift-S#154Validation mIoU: 47.8
semantic-segmentation-on-ade20kShift-T#172Validation mIoU: 46.3