HTML: Hybrid Temporal-scale Multimodal Learning Framework for Referring Video Object Segmentation

Benchmark Model Rank Results
referring-video-object-segmentation-on-ref-davis17HTML–J&F: 62.1J: 59.2F: 65.1
referring-video-object-segmentation-on-refer-youtube-vosHTML-ResNet101–J&F: 58.5J: 57.3F: 59.8
referring-video-object-segmentation-on-refer-youtube-vosHTML-ResNet50–J&F: 57.8J: 56.5F: 59.0
referring-video-object-segmentation-on-refer-youtube-vosHTML-SwinL–J&F: 63.4J: 61.5F: 65.3
referring-video-object-segmentation-on-refer-youtube-vosHTML-Video-SwinB–J&F: 63.4J: 61.5F: 65.2
referring-video-object-segmentation-on-refer-youtube-vosHTML-Video-SwinS–J&F: 61.4J: 59.9F: 62.9
referring-video-object-segmentation-on-refer-youtube-vosHTML-Video-SwinT–J&F: 61.2J: 59.5F: 63.0