Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning

Benchmark Model Rank Results
action-classification-on-kinetics-400MVD (K400 pretrain, ViT-H, 16x224x224)#34Acc@1: 87.2Acc@5: 97.4
action-classification-on-kinetics-400MVD (K400 pretrain, ViT-L, 16x224x224)#41Acc@1: 86.4Acc@5: 97.0
action-classification-on-kinetics-400MVD (K400 pretrain, ViT-B, 16x224x224)#60Acc@1: 83.4Acc@5: 95.8
action-classification-on-kinetics-400MVD (K400 pretrain, ViT-S, 16x224x224)#79Acc@1: 81.0Acc@5: 94.8
action-recognition-in-videos-on-somethingMVD (Kinetics400 pretrain, ViT-H, 16 frame)#1Top-1 Accuracy: 77.3Top-5 Accuracy: 95.7Parameters: 633
action-recognition-in-videos-on-somethingMVD (Kinetics400 pretrain, ViT-L, 16 frame)#6Top-1 Accuracy: 76.7Top-5 Accuracy: 95.5Parameters: 305
action-recognition-in-videos-on-somethingMVD (Kinetics400 pretrain, ViT-B, 16 frame)#17Top-1 Accuracy: 73.7Top-5 Accuracy: 94.0Parameters: 87
action-recognition-in-videos-on-somethingMVD (Kinetics400 pretrain, ViT-S, 16 frame)#32Top-1 Accuracy: 70.9Top-5 Accuracy: 92.8Parameters: 22GFLOPs: 57x6
action-recognition-on-ava-v2-2MVD (Kinetics400 pretrain+finetune, ViT-H, 16x4)#4mAP: 41.1
action-recognition-on-ava-v2-2MVD (Kinetics400 pretrain, ViT-H, 16x4)#6mAP: 40.1
action-recognition-on-ava-v2-2MVD (Kinetics400 pretrain+finetune, ViT-L, 16x4)#11mAP: 38.7
action-recognition-on-ava-v2-2MVD (Kinetics400 pretrain, ViT-L, 16x4)#13mAP: 37.7
action-recognition-on-ava-v2-2MVD (Kinetics400 pretrain+finetune, ViT-B, 16x4)#19mAP: 34.2
action-recognition-on-ava-v2-2MVD (Kinetics400 pretrain, ViT-B, 16x4)#23mAP: 31.1
self-supervised-action-recognition-on-hmdb51MVD (ViT-B)#1Top-1 Accuracy: 79.7Pre-Training Dataset: Kinetics400Frozen: false
self-supervised-action-recognition-on-ucf101MVD (ViT-B)#23-fold Accuracy: 97.5Pre-Training Dataset: Kinetics400Frozen: false