VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking

Benchmark Model Rank Results
action-classification-on-kinetics-400VideoMAE V2-g (64x266x266)#9Acc@1: 90.0Acc@5: 98.4
action-classification-on-kinetics-400VideoMAE V2-g#21Acc@1: 88.5Acc@5: 98.1
action-classification-on-kinetics-600VideoMAE V2-g (64x266x266)#10Top-1 Accuracy: 89.9Top-5 Accuracy: 98.5
action-classification-on-kinetics-600VideoMAE V2-g#14Top-1 Accuracy: 88.8Top-5 Accuracy: 98.2
action-recognition-in-videos-on-hmdb-51VideoMAE V2-g#1Average accuracy of 3 splits: 88.7
action-recognition-in-videos-on-somethingVideoMAE V2-g#5Top-1 Accuracy: 77.0Top-5 Accuracy: 95.9Parameters: 1013
action-recognition-in-videos-on-something-1VideoMAE V2-g#2Top 1 Accuracy: 68.7Top 5 Accuracy: 91.9
action-recognition-in-videos-on-ucf101VideoMAE V2-g#13-fold Accuracy: 99.6
action-recognition-on-ava-v2-2VideoMAE V2-g#3mAP: 42.6
self-supervised-action-recognition-on-ucf101VideoMAE V2-g#13-fold Accuracy: 99.6
spatio-temporal-action-localization-on-avaVideoMAE V2-g#1val mAP: 42.6
temporal-action-localization-on-fineactionVideoMAE V2-g#5mAP: 18.24mAP IOU@0.5: 29.07mAP IOU@0.75: 17.66mAP IOU@0.95: 5.07
temporal-action-localization-on-thumos14ActionFormer (VideoMAE V2-g features)#8Avg mAP (0.3:0.7): 69.6mAP IOU@0.3: 84.0mAP IOU@0.4: 79.6