TarViS: A Unified Approach for Target-based Video Segmentation

Benchmark Model Rank Results
video-instance-segmentation-on-ovis-1TarViS (Swin-L)#12mask AP: 43.2AP50: 67.8AP75: 44.6AR1: 18.0AR10: 50.4
video-instance-segmentation-on-ovis-1TarViS (Swin-T)#24mask AP: 34.0AP50: 55.0AP75: 34.4AR1: 16.1AR10: 40.9
video-instance-segmentation-on-ovis-1TarViS (ResNet-50)#26mask AP: 31.1AP50: 52.5AP75: 30.4AR1: 15.9AR10: 39.9
video-instance-segmentation-on-youtube-vis-2TarViS (Swin-L)#6mask AP: 60.2AP50: 81.4AP75: 67.6AR1: 47.6AR10: 64.8
video-instance-segmentation-on-youtube-vis-2TarViS (Swin-T)#18mask AP: 50.9AP50: 71.6AP75: 56.6AR1: 42.2AR10: 57.2
video-instance-segmentation-on-youtube-vis-2TarViS (ResNet-50)#20mask AP: 48.3AP50: 69.6AP75: 53.2AR1: 40.5AR10: 55.9
video-panoptic-segmentation-on-cityscapes-vpsTarViS (Swin-L)#4VPQ: 58.9VPQ (thing): 43.7VPQ (stuff): 69.9
video-panoptic-segmentation-on-cityscapes-vpsTarViS (Swin-T)#5VPQ: 58.0VPQ (thing): 42.9VPQ (stuff): 69.0
video-panoptic-segmentation-on-cityscapes-vpsTarViS (ResNet-50)#7VPQ: 53.3VPQ (thing): 35.9VPQ (stuff): 66.0
video-panoptic-segmentation-on-kitti-stepTarViS (Swin-L)#2AQ: 72.0SQ: 72.0STQ: 73.0
video-panoptic-segmentation-on-kitti-stepTarViS (Swin-T)#3AQ: 71.2SQ: 69.9STQ: 70.6
video-panoptic-segmentation-on-kitti-stepTarViS (ResNet-50)#4AQ: 70.3SQ: 68.8STQ: 69.6
video-panoptic-segmentation-on-vipsegTarViS (Swin-L)#9VPQ: 48.0STQ: 52.9
video-panoptic-segmentation-on-vipsegTarViS (Swin-T)#11VPQ: 35.8STQ: 45.3
video-panoptic-segmentation-on-vipsegTarViS (ResNet-50)#12VPQ: 33.5STQ: 43.1
visual-object-tracking-on-davis-2017TarViS#19J&F: 85.3Jaccard (Mean): 81.7F-measure (Mean): 88.5