SOC: Semantic-Assisted Object Cluster for Referring Video Object Segmentation

Benchmark Model Rank Results
referring-expression-segmentation-on-a2dSOC (Video-Swin-B)#2AP: 0.573IoU overall: 0.807IoU mean: 0.725Precision@0.5: 0.851
referring-expression-segmentation-on-a2dSOC (Video-Swin-T)#4AP: 0.504IoU overall: 0.747IoU mean: 0.669Precision@0.5: 0.79
referring-expression-segmentation-on-j-hmdbSOC (Video-Swin-B)#2AP: 0.446IoU overall: 0.736IoU mean: 0.723Precision@0.5: 0.969
referring-expression-segmentation-on-j-hmdbSOC (Video-Swin-T)#3AP: 0.397IoU overall: 0.707IoU mean: 0.701Precision@0.5: 0.947
referring-expression-segmentation-on-refer-1SOC (Joint training, Video-Swin-B)#6J&F: 67.3±0.5J: 65.3F: 69.3
referring-expression-segmentation-on-refer-1SOC (Video-Swin-T)#18J&F: 59.2J: 57.8F: 60.5
referring-video-object-segmentation-on-longSOC#4J&F: 34.9tIoU: 68.1vIoU: 28.6
referring-video-object-segmentation-on-refSOC#4J&F: 65.8J: 62.5F: 69.1
referring-video-object-segmentation-on-referSOC#6J&F: 66.0J: 64.1F: 67.9