ELSA: Enhanced Local Self-Attention for Vision Transformer

Benchmark Model Rank Results
image-classification-on-imagenetELSA-VOLO-D5 (512*512)#98Top 1 Accuracy: 87.2%Number of params: 298MGFLOPs: 437
image-classification-on-imagenetELSA-VOLO-D1#289Top 1 Accuracy: 84.7%Number of params: 27MGFLOPs: 8
image-classification-on-imagenetELSA-Swin-T#495Top 1 Accuracy: 82.7%Number of params: 28MGFLOPs: 4.8
instance-segmentation-on-coco-minivalELSA-S (Cascade Mask RCNN)#53mask AP: 44.4AP50: 67.8AP75: 47.8
instance-segmentation-on-coco-minivalELSA-S (Mask RCNN)#61mask AP: 43.0AP50: 67.3AP75: 46.4
object-detection-on-coco-minivalELSA-S (Cascade Mask RCNN)#71box AP: 51.6AP50: 70.5AP75: 56.0
object-detection-on-coco-minivalELSA-S (Mask RCNN)#91box AP: 48.3AP50: 70.4AP75: 52.9
semantic-segmentation-on-ade20kELSA-Swin-S#111Validation mIoU: 50.3
semantic-segmentation-on-ade20k-valELSA-Swin-S#49mIoU: 50.3