Referred by Multi-Modality: A Unified Temporal Transformer for Video Object Segmentation

Benchmark Model Rank Results
referring-expression-segmentation-on-refer-1MUTR#5J&F: 68.4J: 66.4F: 70.4
referring-video-object-segmentation-on-longMUTR#1J&F: 42.2tIoU: 70.4vIoU: 36.2
referring-video-object-segmentation-on-refMUTR#3J&F: 68.0J: 64.8F: 71.3