Video Object Segmentation with Language Referring Expressions

Benchmark Model Rank Results
referring-expression-segmentation-on-davisKhoreva et al.J&F 1st frame: 39.3J&F Full video: 37.1
video-object-segmentation-on-davis-2016VOSwL (Language)mIoU: 82.8
video-object-segmentation-on-davis-2016VOSwL (Mask+Language)mIoU: 84.5
video-object-segmentation-on-davis-2017VOSwL (Mask+Language)mIoU: 59J&F: 62.2
visual-object-tracking-on-davis-2016VOSwLJ&F: 83.65Jaccard (Mean): 83.1Jaccard (Recall): 95.7
visual-object-tracking-on-davis-2017VOSwLJaccard (Recall): 66.1Jaccard (Decay): 22.4F-measure (Mean): 63.5
visual-object-tracking-on-davis-2017VOSwL (Language)J&F: 60.8Jaccard (Mean): 58.0