InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions

Benchmark Model Rank Results
image-classification-on-imagenetInternImage-H#14Top 1 Accuracy: 89.6%Number of params: 1080MGFLOPs: 1478
image-classification-on-imagenetInternImage-XL#62Top 1 Accuracy: 88%Number of params: 335MGFLOPs: 163
image-classification-on-imagenetInternImage-L#76Top 1 Accuracy: 87.7%Number of params: 223MGFLOPs: 108
image-classification-on-imagenetInternImage-B#271Top 1 Accuracy: 84.9%Number of params: 97MGFLOPs: 16
image-classification-on-imagenetInternImage-S#331Top 1 Accuracy: 84.2%Number of params: 50MGFLOPs: 8
image-classification-on-imagenetInternImage-DCNv3-G (M3I Pre-training)#988Number of params: 3000M
image-classification-on-inaturalist-2018InternImage-H#1Top-1 Accuracy: 92.6%
image-classification-on-places205InternImage-H#1Top 1 Accuracy: 71.7%
image-classification-on-places365InternImage-H(CNN)#1Top 1 Accuracy: 61.2%
instance-segmentation-on-cocoInternImage-H#102AP50: 80.8AP75: 62.2APS: 41.0APM: 58.9APL: 70.3
instance-segmentation-on-coco-minivalInternImage-H#3mask AP: 55.4AP50: 80.1AP75: 61.5APL: 74.4APM: 58.4APS: 37.9
instance-segmentation-on-coco-minivalInternImage-XL#30mask AP: 48.8GFLOPs: 1782Params (M): 387
instance-segmentation-on-coco-minivalInternImage-L#34mask AP: 48.5GFLOPs: 1399Params (M): 277box AP: 56.1
instance-segmentation-on-coco-minivalInternImage-S#51mask AP: 44.5GFLOPs: 340Params (M): 69box AP: 49.7
instance-segmentation-on-coco-minivalInternImage-T#58mask AP: 43.7GFLOPs: 270Params (M): 49box AP: 49.1
instance-segmentation-on-coco-minivalInternImage-B#89GFLOPs: 501Params (M): 115
object-detection-on-cocoInternImage-H (M3I Pre-training)#2box mAP: 65.5Params (M): 2180
object-detection-on-cocoInternImage-XL#9box mAP: 64.3Params (M): 602
object-detection-on-coco-minivalInternImage-H#5box AP: 65.0
object-detection-on-coco-minivalInternImage-XL#12box AP: 64.2
object-detection-on-coco-oInternImage-L (Cascade Mask R-CNN)#8Average mAP: 37.0Effective Robustness: 11.72
object-detection-on-crowdhuman-full-bodyInternImage-H#1AP: 97.2
object-detection-on-lvis-v1-0-minivalInternImage-H#3box AP: 65.8
object-detection-on-lvis-v1-0-valInternImage-H#3box AP: 63.2
object-detection-on-pascal-voc-2012InternImage-H#1MAP: 97.2
semantic-segmentation-on-ade20kInternImage-H#3Validation mIoU: 62.9Params (M): 1310GFLOPs: 4635
semantic-segmentation-on-ade20kInternImage-XL#46Validation mIoU: 55.3Params (M): 368GFLOPs: 3142
semantic-segmentation-on-ade20kInternImage-L#65Validation mIoU: 54.1Params (M): 256GFLOPs: 2526
semantic-segmentation-on-ade20kInternImage-B#95Validation mIoU: 51.3Params (M): 128GFLOPs: 1185
semantic-segmentation-on-ade20kInternImage-S#105Validation mIoU: 50.9Params (M): 80GFLOPs: 1017
semantic-segmentation-on-ade20kInternImage-T#151Validation mIoU: 48.1Params (M): 59GFLOPs: 944
semantic-segmentation-on-ade20kInternImage-H (M3I Pre-training)#222Params (M): 1310
semantic-segmentation-on-cityscapesInternImage-H#3Mean IoU (class): 86.1%
semantic-segmentation-on-cityscapes-valInternImage-H#4mIoU: 87
semantic-segmentation-on-cityscapes-valInternImage-XL#6mIoU: 86.4
semantic-segmentation-on-pascal-contextInternImage-H#2mIoU: 70.3
semantic-segmentation-on-replicaInternImage#2mIoU: 38.4