Bottleneck Transformers for Visual Recognition

Benchmark Model Rank Results
image-classification-on-imagenetBoTNet T7#287Top 1 Accuracy: 84.7%Number of params: 75.1M
image-classification-on-imagenetBoTNet T7-320#327Top 1 Accuracy: 84.2%
image-classification-on-imagenetBoTNet T6#353Top 1 Accuracy: 84%Number of params: 53.9M
image-classification-on-imagenetSENet-350#373Top 1 Accuracy: 83.8%
image-classification-on-imagenetBoTNet T5#408Top 1 Accuracy: 83.5%GFLOPs: 19.3
image-classification-on-imagenetBoTNet T4#478Top 1 Accuracy: 82.8%Number of params: 54.7MGFLOPs: 10.9
image-classification-on-imagenetSENet-152#542Top 1 Accuracy: 82.2%Number of params: 66.6M
image-classification-on-imagenetBoTNet T3#592Top 1 Accuracy: 81.7%Number of params: 33.5MGFLOPs: 7.3
image-classification-on-imagenetSENet-101#616Top 1 Accuracy: 81.4%Number of params: 49.2M
image-classification-on-imagenetResNet-101#686Top 1 Accuracy: 80%Number of params: 44.4M
image-classification-on-imagenetSENet-50#716Top 1 Accuracy: 79.4%Number of params: 28.02M
image-classification-on-imagenetResNet-50#760Top 1 Accuracy: 78.8%Number of params: 25.5M
instance-segmentation-on-coco-minivalBoTNet 200 (Mask R-CNN, single scale, 72 epochs)#52mask AP: 44.4
instance-segmentation-on-coco-minivalBoTNet 152 (Mask R-CNN, single scale, 72 epochs)#56mask AP: 43.7
instance-segmentation-on-coco-minivalBoTNet 50 (72 epochs)#68mask AP: 40.7
object-detection-on-coco-minivalBoTNet 200 (Mask R-CNN, single scale, 72 epochs)#83box AP: 49.7AP50: 71.3AP75: 54.6
object-detection-on-coco-minivalBoTNet 152 (Mask R-CNN, single scale, 72 epochs)#84box AP: 49.5AP50: 71AP75: 54.2
object-detection-on-coco-minivalBoTNet 50 (72 epochs)#110box AP: 45.9