Rethinking Spatiotemporal Feature Learning: Speed-Accuracy Trade-offs in Video Classification

Benchmark Model Rank Results
action-classification-on-kinetics-400S3D-G (RGB+Flow, ImageNet pretrained)#124Acc@1: 77.2Acc@5: 93
action-classification-on-kinetics-400S3D-G (RGB, ImageNet pretrained)#138Acc@1: 74.7Acc@5: 93.4
action-classification-on-kinetics-400S3D-G (Flow, ImageNet pretrained)#156Acc@1: 68Acc@5: 87.6
action-classification-on-kinetics-600S3D-G (RGB+Flow)#46Top-1 Accuracy: 78.6
action-classification-on-kinetics-600S3D-G (RGB)#49Top-1 Accuracy: 76.6
action-classification-on-kinetics-600S3D-G (Flow)#53Top-1 Accuracy: 69.7
action-recognition-in-videos-on-hmdb-51S3D-G (ImageNet, Kinetics-400 pretrained)#24Average accuracy of 3 splits: 75.9
action-recognition-in-videos-on-something-1S3D-G (ImageNet pretrained)#51Top 1 Accuracy: 48.2Top 5 Accuracy: 78.7
action-recognition-in-videos-on-something-1S3D#53Top 1 Accuracy: 47.3Top 5 Accuracy: 78.1
action-recognition-in-videos-on-ucf101S3D-G (ImageNet, Kinetics-400 pretrained)#183-fold Accuracy: 96.8