Collaborative Spatial-Temporal Modeling for Language-Queried Video Actor Segmentation

Benchmark Model Rank Results
referring-expression-segmentation-on-a2d-sentencesHui et al.–AP: 0.399IoU overall: 0.662IoU mean: 0.561Precision@0.5: 0.654…
referring-expression-segmentation-on-j-hmdbHui et al.–AP: 0.335IoU overall: 0.598IoU mean: 0.604Precision@0.5: 0.783…