MogaNet: Multi-order Gated Aggregation Network

Benchmark Model Rank Results
image-classification-on-imagenetMogaNet-XL (384res)#72Top 1 Accuracy: 87.8%Number of params: 181MGFLOPs: 102
image-classification-on-imagenetMogaNet-L#293Top 1 Accuracy: 84.7%Number of params: 83MGFLOPs: 15.9
image-classification-on-imagenetMogaNet-B#322Top 1 Accuracy: 84.3%Number of params: 44MGFLOPs: 9.9
image-classification-on-imagenetMogaNet-S#420Top 1 Accuracy: 83.4%Number of params: 25MGFLOPs: 5
image-classification-on-imagenetMogaNet-T (256res)#689Top 1 Accuracy: 80%Number of params: 5.2MGFLOPs: 1.44
image-classification-on-imagenetMogaNet-XT (256res)#828Top 1 Accuracy: 77.2%Number of params: 3MGFLOPs: 1.04
instance-segmentation-on-cocoMogaNet-XL (Cascade Mask R-CNN)#26mask AP: 48.8
instance-segmentation-on-cocoMogaNet-L (Cascade Mask R-CNN)#38mask AP: 46.1
instance-segmentation-on-cocoMogaNet-B (Cascade Mask R-CNN)#39mask AP: 46
instance-segmentation-on-cocoMogaNet-S (Cascade Mask R-CNN)#42mask AP: 45.1
instance-segmentation-on-cocoMogaNet-L (Mask R-CNN 1x)#44mask AP: 44.1
instance-segmentation-on-cocoMogaNet-B (Mask R-CNN 1x)#47mask AP: 43.2
instance-segmentation-on-cocoMogaNet-S (Mask R-CNN 1x)#51mask AP: 42.2
instance-segmentation-on-cocoMogaNet-T (Mask R-CNN 1x)#78mask AP: 39.1
instance-segmentation-on-cocoMogaNet-XT#86mask AP: 37.6
instance-segmentation-on-cocoMogaNet-T#92mask AP: 35.8
object-detection-on-coco-2017-valMogaNet-XL (Cascade Mask R-CNN)#9AP: 56.2
object-detection-on-coco-2017-valMogaNet-L (Cascade Mask R-CNN)#10AP: 53.3
object-detection-on-coco-2017-valMogaNet-B (Cascade Mask R-CNN)#11AP: 52.6
object-detection-on-coco-2017-valMogaNet-S (Cascade Mask R-CNN)#14AP: 51.6
object-detection-on-coco-2017-valMogaNet-L (Mask R-CNN 1x)#18AP: 49.4
object-detection-on-coco-2017-valMogaNet-L (RetinaNet 1x)#21AP: 48.7
object-detection-on-coco-2017-valMogaNet-B (Mask R-CNN 1x)#22AP: 47.9
object-detection-on-coco-2017-valMogaNet-B (RetinaNet 1x)#23AP: 47.7
object-detection-on-coco-2017-valMogaNet-S (Mask R-CNN 1x)#25AP: 46.7
object-detection-on-coco-2017-valMogaNet-S (RetinaNet 1x)#26AP: 45.8
object-detection-on-coco-2017-valMogaNet-T (Mask R-CNN 1x)#28AP: 42.6
object-detection-on-coco-2017-valMogaNet-T (RetinaNet 1x)#29AP: 41.4
object-detection-on-coco-2017-valMogaNet-XT (Mask R-CNN 1x)#30AP: 40.7
object-detection-on-coco-2017-valMogaNet-XT (RetinaNet 1x)#32AP: 39.7
pose-estimation-on-coco-val2017MogaNet-B (384x288)#2AP: 77.3AR: 82.2AP50: 91.4AP75: 84
pose-estimation-on-coco-val2017MogaNet-S (384x288)#3AP: 76.4AR: 81.4AP50: 91AP75: 83.3
pose-estimation-on-coco-val2017MogaNet-S (256x192)#6AP: 74.9AR: 80.1
pose-estimation-on-coco-val2017MogaNet-T (256x192)#7AP: 73.2AR: 78.8AP50: 90.1AP75: 81
semantic-segmentation-on-ade20kMogaNet-XL (UperNet)#68Validation mIoU: 54
semantic-segmentation-on-ade20kMogaNet-L (UperNet)#104Validation mIoU: 50.9GFLOPs (512 x 512): 1176
semantic-segmentation-on-ade20kMogaNet-B (UperNet)#117Validation mIoU: 50.1GFLOPs (512 x 512): 1050
semantic-segmentation-on-ade20kMogaNet-S (UperNet)#134Validation mIoU: 49.2GFLOPs (512 x 512): 946
semantic-segmentation-on-ade20kMogaNet-S (Semantic FPN)#155Validation mIoU: 47.7GFLOPs (512 x 512): 189
video-prediction-on-moving-mnistMogaNet (SimVP 10x)#4MSE: 15.67MAE: 51.84SSIM: 0.9661
video-prediction-on-moving-mnistVAN (SimVP 10x)#5MSE: 16.21MAE: 53.57SSIM: 0.9646
video-prediction-on-moving-mnistHorNet (SimVP 10x)#6MSE: 17.4MAE: 55.7SSIM: 0.9624
video-prediction-on-moving-mnistConvNeXt (SimVP 10x)#7MSE: 17.58MAE: 55.76SSIM: 0.9617
video-prediction-on-moving-mnistUniformer (SimVP 10x)#9MSE: 18.01MAE: 57.52
video-prediction-on-moving-mnistMLP-Mixer (SimVP 10x)#10MSE: 18.85MAE: 59.86
video-prediction-on-moving-mnistSwin (SimVP 10x)#12MSE: 19.11MAE: 59.84
video-prediction-on-moving-mnistViT (SimVP 10x)#13MSE: 19.74MAE: 61.65SSIM: 0.9539
video-prediction-on-moving-mnistPoolformer (SimVP 10x)#15MSE: 20.96MAE: 64.31
video-prediction-on-moving-mnistConvMixer (SimVP 10x)#17MSE: 22.3MAE: 67.37