MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models

Benchmark Model Rank Results
image-classification-on-imagenetMOAT-4 22K+1K#24Top 1 Accuracy: 89.1%Number of params: 483.2MGFLOPs: 648.5
image-classification-on-imagenetMOAT-3 1K only#126Top 1 Accuracy: 86.7%Number of params: 190MGFLOPs: 271
image-classification-on-imagenetMOAT-0 1K only#433Top 1 Accuracy: 83.3%Number of params: 27.8MGFLOPs: 5.7
image-classification-on-imagenet-v2MOAT-4 (IN-22K pretraining)#8Top 1 Accuracy: 81.5
image-classification-on-imagenet-v2MOAT-3 (IN-22K pretraining)#10Top 1 Accuracy: 80.6
image-classification-on-imagenet-v2MOAT-2 (IN-22K pretraining)#11Top 1 Accuracy: 79.3
image-classification-on-imagenet-v2MOAT-1 (IN-22K pretraining)#12Top 1 Accuracy: 78.4
instance-segmentation-on-coco-minivalMOAT-3 (IN-22K pretraining, single-scale)#23mask AP: 50.3
instance-segmentation-on-coco-minivalMOAT-2 (IN-22K pretraining, single-scale)#26mask AP: 49.3
instance-segmentation-on-coco-minivalMOAT-1 (IN-1K pretraining, single-scale)#27mask AP: 49.0
instance-segmentation-on-coco-minivalMOAT-0 (IN-1K pretraining, single-scale)#36mask AP: 47.4
instance-segmentation-on-coco-minivaltiny-MOAT-3 (IN-1K pretraining, single-scale)#39mask AP: 47.0
instance-segmentation-on-coco-minivaltiny-MOAT-2 (IN-1K pretraining, single-scale)#47mask AP: 45.0
instance-segmentation-on-coco-minivaltiny-MOAT-1 (IN-1K pretraining, single-scale)#49mask AP: 44.6
instance-segmentation-on-coco-minivaltiny-MOAT-0 (IN-1K pretraining, single-scale)#59mask AP: 43.3
object-detection-on-coco-1MOAT-2#1box AP: 58.5
object-detection-on-coco-1MOAT-3 22K+1K#2box AP: 59.2
object-detection-on-coco-minivalMOAT-3 (IN-22K pretraining, single-scale)#31box AP: 59.2
object-detection-on-coco-minivalMOAT-2 (IN-22K pretraining, single-scale)#35box AP: 58.5
object-detection-on-coco-minivalMOAT-1 (IN-1K pretraining, single-scale)#38box AP: 57.7
object-detection-on-coco-minivalMOAT-0 (IN-1K pretraining, single-scale)#47box AP: 55.9
object-detection-on-coco-minivaltiny-MOAT-3 (IN-1K pretraining, single-scale)#50box AP: 55.2
object-detection-on-coco-minivaltiny-MOAT-2 (IN-1K pretraining, single-scale)#63box AP: 53.0
object-detection-on-coco-minivaltiny-MOAT-1 (IN-1K pretraining, single-scale)#69box AP: 51.9
object-detection-on-coco-minivaltiny-MOAT-0 (IN-1K pretraining, single-scale)#78box AP: 50.5
semantic-segmentation-on-ade20kMOAT-4 (IN-22K pretraining, single-scale)#29Validation mIoU: 57.6Params (M): 496
semantic-segmentation-on-ade20kMOAT-3 (IN-22K pretraining, single-scale)#37Validation mIoU: 56.5Params (M): 198
semantic-segmentation-on-ade20kMOAT-2 (IN-22K pretraining, single-scale)#55Validation mIoU: 54.7Params (M): 81
semantic-segmentation-on-ade20ktiny-MOAT-3 (IN-1K pretraining, single scale)#160Validation mIoU: 47.5Params (M): 24
semantic-segmentation-on-ade20ktiny-MOAT-2 (IN-1K pretraining, single scale)#191Validation mIoU: 44.9Params (M): 13
semantic-segmentation-on-ade20ktiny-MOAT-1 (IN-1K pretraining, single scale)#204Validation mIoU: 43.1Params (M): 8
semantic-segmentation-on-ade20ktiny-MOAT-0 (IN-1K pretraining, single scale)#208Validation mIoU: 41.2Params (M): 6