GLIPv2: Unifying Localization and Vision-Language Understanding

Benchmark Model Rank Results
object-detection-on-cocoGLIPv2 (CoSwin-H, multi-scale)#20box mAP: 62.4
object-detection-on-lvis-v1-0-minivalGLIPv2#5box AP: 59.8
object-detection-on-odinw-full-shot-13-tasksGLIPv2#4AP: 70.4
phrase-grounding-on-flickr30k-entities-testGLIPv2#1R@1: 87.7
referring-expression-segmentation-onGLIPv2#1Mean IoU: 61.3