HIRI-ViT: Scaling Vision Transformer with High Resolution Inputs

Benchmark Model Rank Results
object-detection-on-coco-val2017HIRI-ViT-B (Mask R-CNN 1x, 1600px input)–box AP: 49.1AP50: 71.0AP75: 54.3Params (M): 69.4
object-detection-on-coco-val2017HIRI-ViT-B (RetinaNet 1x, 1600px input)–box AP: 48.4AP50: 69.7AP75: 51.9APS: 33.4APM: 52.6APL: 63.4…
object-detection-on-coco-val2017HIRI-ViT-S (Cascade Mask R-CNN 3x, 1600px input)–box AP: 52.6AP50: 71.3AP75: 57.1Params (M): 88.9
object-detection-on-coco-val2017HIRI-ViT-S (Sparse R-CNN 3x, 1600px input)–box AP: 51.9AP50: 71.9AP75: 56.6Params (M): 113.0