Extending Video Masked Autoencoders to 128 frames

Benchmark Model Rank Results
action-recognition-on-diving-48LVMAEAccuracy: 94.9
action-recognition-on-epic-kitchens-100LVMAEAction@1: 52.1Verb@1: 75.0Noun@1: 61.8