BiFormer: Vision Transformer with Bi-Level Routing Attention

Benchmark Model Rank Results
image-classification-on-imagenetBiFormer-B* (IN1k ptretrain)#229Top 1 Accuracy: 85.4%
image-classification-on-imagenetBiFormer-S* (IN1k ptretrain)#323Top 1 Accuracy: 84.3%
image-classification-on-imagenetBiFormer-T (IN1k ptretrain)#621Top 1 Accuracy: 81.4%
object-detection-on-coco-2017BiFormer-B (IN1k pretrain, MaskRCNN 12ep)#14mAP: 48.6
object-detection-on-coco-2017BiFormer-S (IN1k pretrain, MaskRCNN 12ep)#16mAP: 47.8
semantic-segmentation-on-ade20kBiFormer-B (IN1k pretrain, Upernet 160k)#90Validation mIoU: 51.7
semantic-segmentation-on-ade20kUpernet-BiFormer-S (IN1k pretrain, Upernet 160k)#107Validation mIoU: 50.8