Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
Open paper
Benchmark
Model
Rank
Results
referring-expression-segmentation-on-refer-1
VLP (VLMo-L)
–
J&F: 67.6
J: 65.3
F: 69.8
Rank counts only results with a code link.