Language as Queries for Referring Video Object Segmentation

Benchmark Model Rank Results
referring-expression-segmentation-on-a2dReferFormer (Video-Swin-B)#3AP: 0.550IoU overall: 0.786IoU mean: 0.703Precision@0.5: 0.831
referring-expression-segmentation-on-davisReferFormer#6J&F 1st frame: 61.1
referring-expression-segmentation-on-refer-1ReferFormer (ResNet-101)#20J&F: 57.3J: 56.1F: 58.4
referring-expression-segmentation-on-refer-1ReferFormer (ResNet-50)#22J&F: 55.6J: 54.8F: 56.6
referring-video-object-segmentation-on-mevisReferFormer#12J&F: 31.0J: 29.8F: 32.2
referring-video-object-segmentation-on-refReferFormer#8J&F: 61.1J: 58.1F: 64.1
referring-video-object-segmentation-on-referReferFormer (Large)#10J&F: 62.9J: 61.3F: 64.6
referring-video-object-segmentation-on-revosReferFormer (Video-Swin-B)#7J&F: 28.1J: 26.2F: 29.9R: 8.8