End-to-End Referring Video Object Segmentation with Multimodal Transformers

Benchmark Model Rank Results
referring-expression-segmentation-on-a2dMTTR (w=10)#7AP: 0.461IoU overall: 0.72IoU mean: 0.64Precision@0.5: 0.754
referring-expression-segmentation-on-a2dMTTR (w=8)#8AP: 0.447IoU overall: 0.702IoU mean: 0.618Precision@0.5: 0.721
referring-expression-segmentation-on-j-hmdbMTTR (w=10)#4AP: 0.392IoU overall: 0.701IoU mean: 0.698Precision@0.5: 0.939
referring-expression-segmentation-on-j-hmdbMTTR (w=8)#5AP: 0.366IoU overall: 0.674IoU mean: 0.679Precision@0.5: 0.91
referring-expression-segmentation-on-refer-1MTTR (w=12)#23J&F: 55.32J: 54.00F: 56.64
referring-video-object-segmentation-on-mevisMTTR#13J&F: 30.0J: 28.8F: 31.2
referring-video-object-segmentation-on-revosMTTR (Video-Swin-T)#9J&F: 25.5J: 25.1F: 25.9R: 5.6