Extending Video Masked Autoencoders to 128 frames
Open paper
Benchmark
Model
Rank
Results
action-recognition-on-diving-48
LVMAE
–
Accuracy: 94.9
action-recognition-on-epic-kitchens-100
LVMAE
–
Action@1: 52.1
Verb@1: 75.0
Noun@1: 61.8
Rank counts only results with a code link.