Towards All-in-one Pre-training via Maximizing Multi-modal Mutual Information

Benchmark Model Rank Results
image-classification-on-imagenetM3I Pre-training (InternImage-H)#15Top 1 Accuracy: 89.6%
object-detection-on-cocoM3I Pre-training (InternImage-H)#3box mAP: 65.4
object-detection-on-coco-minivalM3I Pre-training (InternImage-H)#6box AP: 65.0
object-detection-on-lvis-v1-0-minivalM3I Pre-training (InternImage-H, single-scale)#4box AP: 65.8
semantic-segmentation-on-ade20kM3I Pre-training (InternImage-H)#4Validation mIoU: 62.9Params (M): 1310