| cross-domain-few-shot-object-detection-on | ViTDeT-FT | #7 | mAP: 23.4 |
| cross-domain-few-shot-object-detection-on-1 | ViTDeT-FT | #7 | mAP: 25.6 |
| cross-domain-few-shot-object-detection-on-2 | ViTDeT-FT | #4 | mAP: 29.4 |
| cross-domain-few-shot-object-detection-on-3 | ViTDeT-FT | #8 | mAP: 6.5 |
| cross-domain-few-shot-object-detection-on-4 | ViTDeT-FT | #6 | mAP: 15.8 |
| cross-domain-few-shot-object-detection-on-neu | ViTDeT-FT | #4 | mAP: 15.8 |
| instance-segmentation-on-coco-minival | ViTDet, ViT-H Cascade (multiscale) | #9 | mask AP: 53.1 |
| instance-segmentation-on-coco-minival | ViTDet, ViT-H Cascade | #15 | mask AP: 52 |
| instance-segmentation-on-lvis-v1-0-val | ViTDet-H | #4 | mask AP: 48.1mask APr: 36.9 |
| instance-segmentation-on-lvis-v1-0-val | ViTDet-L | #5 | mask AP: 46.0mask APr: 34.3 |
| object-detection-on-coco-minival | ViTDet, ViT-H Cascade (multiscale) | #19 | box AP: 61.3 |
| object-detection-on-coco-minival | ViTDet, ViT-H Cascade | #24 | box AP: 60.4 |
| object-detection-on-coco-o | ViTDet (ViT-H) | #10 | Average mAP: 34.3 |
| object-detection-on-coco-o | ViTDet
(ViT-H) | #43 | Effective Robustness: 7.89 |
| object-detection-on-lvis-v1-0-val | ViTDet-H | #7 | box AP: 53.4 |
| object-detection-on-lvis-v1-0-val | ViTDet-L | #9 | box AP: 51.2 |