ViViT: A Video Vision Transformer

Benchmark Model Rank Results
action-classification-on-kinetics-400ViViT-H/16x2 (JFT)#53Acc@1: 84.9Acc@5: 95.8
action-classification-on-kinetics-400ViViT-L/16x2 320#175Acc@5: 94.7
action-classification-on-kinetics-600ViViT-H/16x2 (JFT)#23Top-1 Accuracy: 85.8Top-5 Accuracy: 96.5
action-classification-on-kinetics-600ViViT-L/16x2#28Top-1 Accuracy: 84.3Top-5 Accuracy: 95.6
action-classification-on-kinetics-600ViViT-L/16x2 (320x320)#35Top-1 Accuracy: 83.0Top-5 Accuracy: 95.7
action-classification-on-moments-in-timeViViT-L/16x2#24Top 5 Accuracy: 64.9
action-recognition-in-videos-on-somethingViViT-L/16x2 Fact. encoder#76Top-1 Accuracy: 65.4Top-5 Accuracy: 89.8
action-recognition-on-epic-kitchens-100ViViT-L/16x2 Fact. encoder#19Action@1: 44.0Verb@1: 66.4Noun@1: 56.8