Vision-Language Transformer and Query Generation for Referring Segmentation

Benchmark Model Rank Results
generalized-referring-expressionVLT#4Precision@(F1=1, IoU≥0.5): 36.6N-acc.: 35.2
generalized-referring-expression-segmentationVLT#10gIoU: 52.00cIoU: 52.51
referring-expression-segmentation-on-refcocoVLT#24Overall IoU: 65.65
referring-expression-segmentation-on-refcoco-3VLT#22Overall IoU: 55.50
referring-expression-segmentation-on-refcoco-4VLT#19Overall IoU: 59.20
referring-expression-segmentation-on-refcoco-5VLT#18Overall IoU: 49.36
referring-expression-segmentation-on-refcocogVLT (Darknet53)#18Overall IoU: 52.99
referring-expression-segmentation-on-refcocog-1VLT (Darknet53)#14Overall IoU: 56.65