Modeling Motion with Multi-Modal Features for Text-Based Video Segmentation

Benchmark Model Rank Results
referring-expression-segmentation-on-a2d-sentencesmmmmtbvs#9AP: 0.419IoU overall: 0.673IoU mean: 0.558Precision@0.5: 0.645…