Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation

Benchmark Model Rank Results
referring-expression-segmentation-on-refer-1VLP (VLMo-L)J&F: 67.6J: 65.3F: 69.8