ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations

Benchmark Model Rank Results
referring-expression-segmentation-on-refer-1ReferDINO (Swin-B)J&F: 69.3J: 67.0F: 71.5
referring-video-object-segmentation-on-longReferDINOJ&F: 48.7tIoU: 71.7vIoU: 41.2
referring-video-object-segmentation-on-mevisReferDINO (Swin-B)J&F: 49.3J: 44.7F: 53.9