BEVT: BERT Pretraining of Video Transformers
Open paper
Benchmark
Model
Rank
Results
action-recognition-in-videos-on-something
BEVT (IN-1K + Kinetics400 pretrain)
#27
Top-1 Accuracy: 71.4
Parameters: 89
GFLOPs: 321x3
action-recognition-on-diving-48
BEVT
#6
Accuracy: 86.7
Rank counts only results with a code link.