Masked Feature Prediction for Self-Supervised Visual Pre-Training

Benchmark Model Rank Results
action-classification-on-kinetics-400MaskFeat (K600, MViT-L)#37Acc@1: 87.0Acc@5: 97.4
action-classification-on-kinetics-400MaskFeat (no extra data, MViT-L)#39Acc@1: 86.7Acc@5: 97.3
action-classification-on-kinetics-600MaskFeat (no extra data, MViT-L)#17Top-1 Accuracy: 88.3Top-5 Accuracy: 98.0
action-classification-on-kinetics-700MaskFeat (no extra data, MViT-L)#12Top-1 Accuracy: 80.4Top-5 Accuracy: 95.7
action-recognition-in-videos-on-somethingMaskFeat (Kinetics600 pretrain, MViT-L)#11Top-1 Accuracy: 75.0Top-5 Accuracy: 95.0Parameters: 218
action-recognition-on-ava-v2-2MaskFeat (Kinetics-600 pretrain, MViT-L)#7mAP: 39.8
self-supervised-image-classification-on-1MaskFeat (ViT-L)#21Top 1 Accuracy: 85.7%Number of Params: 307M