MAR: Masked Autoencoders for Efficient Action Recognition

Benchmark Model Rank Results
action-classification-on-kinetics-400MAR (50% mask, ViT-L, 16x4)#48Acc@1: 85.3Acc@5: 96.3
action-classification-on-kinetics-400MAR (75% mask, ViT-L, 16x4)#57Acc@1: 83.9Acc@5: 96.0
action-classification-on-kinetics-400MAR (50% mask, ViT-B, 16x4)#78Acc@1: 81.0Acc@5: 94.4
action-classification-on-kinetics-400MAR (75% mask, ViT-B, 16x4)#97Acc@1: 79.4Acc@5: 93.7
action-recognition-in-videos-on-somethingMAR (50% mask, ViT-L, 16x4)#12Top-1 Accuracy: 74.7Top-5 Accuracy: 94.9Parameters: 311
action-recognition-in-videos-on-somethingMAR (75% mask, ViT-L, 16x4)#16Top-1 Accuracy: 73.8Top-5 Accuracy: 94.4Parameters: 311
action-recognition-in-videos-on-somethingMAR (50% mask, ViT-B, 16x4)#31Top-1 Accuracy: 71.0Top-5 Accuracy: 92.8Parameters: 94GFLOPs: 86x6
action-recognition-in-videos-on-somethingMAR (75% mask, ViT-B, 16x4)#41Top-1 Accuracy: 69.5Top-5 Accuracy: 91.9Parameters: 94GFLOPs: 41x6