| referring-expression-segmentation-on-davis | Khoreva et al. | – | J&F 1st frame: 39.3J&F Full video: 37.1 |
| video-object-segmentation-on-davis-2016 | VOSwL (Language) | – | mIoU: 82.8 |
| video-object-segmentation-on-davis-2016 | VOSwL (Mask+Language) | – | mIoU: 84.5 |
| video-object-segmentation-on-davis-2017 | VOSwL (Mask+Language) | – | mIoU: 59J&F: 62.2 |
| visual-object-tracking-on-davis-2016 | VOSwL | – | J&F: 83.65Jaccard (Mean): 83.1Jaccard (Recall): 95.7… |
| visual-object-tracking-on-davis-2017 | VOSwL | – | Jaccard (Recall): 66.1Jaccard (Decay): 22.4F-measure (Mean): 63.5… |
| visual-object-tracking-on-davis-2017 | VOSwL (Language) | – | J&F: 60.8Jaccard (Mean): 58.0 |