UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer

Benchmark Model Rank Results
action-classification-on-kinetics-400UniFormerV2-L (ViT-L, 336)#8Acc@1: 90.0Acc@5: 98.4FLOPs (G) x views: 75300x3x2
action-classification-on-kinetics-600UniFormerV2-L#9Top-1 Accuracy: 90.1Top-5 Accuracy: 98.5
action-classification-on-kinetics-700UniFormerV2-L#9Top-1 Accuracy: 82.7Top-5 Accuracy: 96.2
action-classification-on-moments-in-timeUniFormerV2-L#3Top 1 Accuracy: 47.8Top 5 Accuracy: 76.9
action-recognition-in-videos-on-somethingUniFormerV2-L#22Top-1 Accuracy: 73.0Top-5 Accuracy: 94.5GFLOPs: 5154
action-recognition-in-videos-on-something-1UniFormerV2-L#7Top 1 Accuracy: 62.7Top 5 Accuracy: 88.0
action-recognition-on-hacsUniFormerV2-L#2Top 1 Accuracy: 95.5Top 5 Accuracy: 99.8