Local-Global Context Aware Transformer for Language-Guided Video Segmentation

Benchmark Model Rank Results
referring-expression-segmentation-on-a2dLocater#6AP: 0.465IoU overall: 0.69IoU mean: 0.597Precision@0.5: 0.709
referring-expression-segmentation-on-refer-1Locater#24J&F: 50J: 48.8F: 51.1