BEVT: BERT Pretraining of Video Transformers

Benchmark Model Rank Results
action-recognition-in-videos-on-somethingBEVT (IN-1K + Kinetics400 pretrain)#27Top-1 Accuracy: 71.4Parameters: 89GFLOPs: 321x3
action-recognition-on-diving-48BEVT#6Accuracy: 86.7