ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense Predictions

Benchmark Model Rank Results
instance-segmentation-on-coco-minivalViT-CoMer-L (Mask RCNN, DINOv2)#2mask AP: 55.9
object-detection-on-coco-minivalViT-CoMer#10box AP: 64.3Params (M): 363
semantic-segmentation-on-ade20k-valViT-CoMer#2mIoU: 62.1