MixFormer: End-to-End Tracking with Iterative Mixed Attention

Benchmark Model Rank Results
semi-supervised-video-object-segmentation-on-15MixFormer-L#14EAO: 0.555
video-object-tracking-on-nv-vot211Mixformer(ConvMAE)#6AUC: 39.23Precision: 54.20
visual-object-tracking-on-avistMixFormerL-22k#3Success Rate: 56.0
visual-object-tracking-on-got-10kMixViT-L(ConvMAE)#20Average Overlap: 75.7Success Rate 0.5: 85.3Success Rate 0.75: 75.1
visual-object-tracking-on-got-10kMixFormer-L#21Average Overlap: 75.6Success Rate 0.5: 85.73Success Rate 0.75: 72.8
visual-object-tracking-on-got-10kMixFormer-1k#25Average Overlap: 71.2Success Rate 0.5: 79.9Success Rate 0.75: 65.8
visual-object-tracking-on-got-10kMixFormer#27Average Overlap: 70.7Success Rate 0.5: 80.0Success Rate 0.75: 67.8
visual-object-tracking-on-lasotMixViT-L(ConvMAE)#14AUC: 73.3Normalized Precision: 82.8Precision: 80.3
visual-object-tracking-on-lasotMixFormer-L#29AUC: 70.1Normalized Precision: 79.9Precision: 76.3
visual-object-tracking-on-trackingnetMixViT-L(ConvMAE)#5Accuracy: 86.1Normalized Precision: 90.3Precision: 86.0
visual-object-tracking-on-trackingnetMixFormer-L#19Accuracy: 83.9Normalized Precision: 88.9Precision: 83.1
visual-object-tracking-on-uav123MixFormer#10AUC: 0.704Precision: 0.918
visual-object-tracking-on-vot2022MixFormerM#4EAO: 0.589