SegAgent: Exploring Pixel Understanding Capabilities in MLLMs by Imitating Human Annotator Trajectories

Benchmark Model Rank Results
referring-expression-segmentation-on-refcocoSegAgent#12Overall IoU: 79.7
referring-expression-segmentation-on-refcoco-3SegAgent#10Overall IoU: 72.49
referring-expression-segmentation-on-refcocogSegAgent#6Overall IoU: 75.11