Referring Segmentation in Images and Videos with Cross-Modal Self-Attention Network

Benchmark Model Rank Results
referring-expression-segmentation-on-a2d-sentencesCMSA+CFSA–IoU overall: 0.618IoU mean: 0.432Precision@0.5: 0.487…
referring-expression-segmentation-on-j-hmdbCMSA+CFSA–IoU overall: 0.628IoU mean: 0.581Precision@0.5: 0.764…