UniFormer: Unified Transformer for Efficient Spatial-Temporal Representation Learning

Benchmark Model Rank Results
action-classification-on-kinetics-400UniFormer-B (ImageNet-1K)#63Acc@1: 82.9Acc@5: 94.5FLOPs (G) x views: 259x4
action-classification-on-kinetics-600UniFormer-B (ImageNet-1K)#25Top-1 Accuracy: 84.8Top-5 Accuracy: 96.7GFLOPs: 259x4
action-recognition-in-videos-on-somethingUniFormer-B (IN-1K + Kinetics400 pretrain)#29Top-1 Accuracy: 71.2Top-5 Accuracy: 92.8Parameters: 50.1
action-recognition-in-videos-on-somethingUniFormer-S (IN-1K + Kinetics600 pretrain)#42Top-1 Accuracy: 69.4Top-5 Accuracy: 92.1Parameters: 21.4
action-recognition-in-videos-on-something-1UniFormer-B (IN-1K + Kinetics400)#8Top 1 Accuracy: 60.9Top 5 Accuracy: 87.3Param.: 50.1GFLOPs: 259x3
action-recognition-in-videos-on-something-1UniFormer-B (IN-1K + Kinetics600)#11Top 1 Accuracy: 57.6Top 5 Accuracy: 84.9Param.: 21.4GFLOPs: 41.8x3