VLT: Vision-Language Transformer and Query Generation for Referring Segmentation

Benchmark Model Rank Results
referring-expression-segmentation-on-refcocoVLT#20Overall IoU: 72.96
referring-expression-segmentation-on-refcoco-3VLT#19Overall IoU: 63.53
referring-expression-segmentation-on-refcoco-4VLT#16Overall IoU: 68.43
referring-expression-segmentation-on-refcoco-5VLT#15Overall IoU: 56.92
referring-expression-segmentation-on-refcocogVLT (Swin-B)#16Overall IoU: 63.49
referring-expression-segmentation-on-refer-1VLT#15J&F: 63.8J: 61.9F: 65.6
referring-video-object-segmentation-on-mevisVLT+TC#10J&F: 35.5J: 33.6F: 37.3
referring-video-object-segmentation-on-referVLT#9J&F: 63.8J: 61.9F: 65.6