Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation

Benchmark Model Rank Results
referring-video-object-segmentation-on-ref-davis17VD-IT#2J&F: 69.4J: 66.2F: 72.6