ViLLa: Video Reasoning Segmentation with Large Language Model

Benchmark Model Rank Results
referring-expression-segmentation-on-refer-1ViLLa#10J&F: 66.5J: 64.6F: 68.6