Exploring Plain Vision Transformer Backbones for Object Detection

Benchmark Model Rank Results
cross-domain-few-shot-object-detection-onViTDeT-FT#7mAP: 23.4
cross-domain-few-shot-object-detection-on-1ViTDeT-FT#7mAP: 25.6
cross-domain-few-shot-object-detection-on-2ViTDeT-FT#4mAP: 29.4
cross-domain-few-shot-object-detection-on-3ViTDeT-FT#8mAP: 6.5
cross-domain-few-shot-object-detection-on-4ViTDeT-FT#6mAP: 15.8
cross-domain-few-shot-object-detection-on-neuViTDeT-FT#4mAP: 15.8
instance-segmentation-on-coco-minivalViTDet, ViT-H Cascade (multiscale)#9mask AP: 53.1
instance-segmentation-on-coco-minivalViTDet, ViT-H Cascade#15mask AP: 52
instance-segmentation-on-lvis-v1-0-valViTDet-H#4mask AP: 48.1mask APr: 36.9
instance-segmentation-on-lvis-v1-0-valViTDet-L#5mask AP: 46.0mask APr: 34.3
object-detection-on-coco-minivalViTDet, ViT-H Cascade (multiscale)#19box AP: 61.3
object-detection-on-coco-minivalViTDet, ViT-H Cascade#24box AP: 60.4
object-detection-on-coco-oViTDet (ViT-H)#10Average mAP: 34.3
object-detection-on-coco-oViTDet (ViT-H)#43Effective Robustness: 7.89
object-detection-on-lvis-v1-0-valViTDet-H#7box AP: 53.4
object-detection-on-lvis-v1-0-valViTDet-L#9box AP: 51.2