Focal Self-attention for Local-Global Interactions in Vision Transformers

Benchmark Model Rank Results
instance-segmentation-on-cocoFocal-L (HTC++, multi-scale)#18mask AP: 51.3AP50: 75.4AP75: 56.5APS: 35.6APL: 64.2
instance-segmentation-on-coco-minivalFocal-L (HTC++, multi-scale)#19mask AP: 50.9
object-detection-on-cocoFocal-L (DyHead, multi-scale)#32box mAP: 58.9
object-detection-on-coco-minivalFocal-L (DyHead, multi-scale)#33box AP: 58.7AP50: 77.2APL: 73.4
semantic-segmentation-on-ade20kFocal-L (UperNet, ImageNet-22k pretrain)#45Validation mIoU: 55.40
semantic-segmentation-on-ade20k-valFocal-L (UperNet, ImageNet-22k pretrain)#29mIoU: 55.4