Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification

Benchmark Model Rank Results
action-recognition-in-videos-on-somethingVoV3D-L (32frames, Kinetics pretrained, single)#57Top-1 Accuracy: 67.35Top-5 Accuracy: 90.50Parameters: 5.8M
action-recognition-in-videos-on-somethingVoV3D-L (32frames, from scratch, single)#72Top-1 Accuracy: 65.8Top-5 Accuracy: 89.5Parameters: 5.8M
action-recognition-in-videos-on-somethingVoV3D-M (32frames, Kinetics pretrained, single)#77Top-1 Accuracy: 65.24Top-5 Accuracy: 89.48Parameters: 3.3M
action-recognition-in-videos-on-somethingVoV3D-M (32frames, from scratch, single)#82Top-1 Accuracy: 64.2Top-5 Accuracy: 88.8Parameters: 3.3M
action-recognition-in-videos-on-somethingVoV3D-L (16frames, from scratch, single)#83Top-1 Accuracy: 64.1Top-5 Accuracy: 88.6Parameters: 5.8M
action-recognition-in-videos-on-somethingVoV3D-M (16frames, from scratch, single)#86Top-1 Accuracy: 63.2Top-5 Accuracy: 88.2Parameters: 3.3M
action-recognition-in-videos-on-something-1VoV3D-L (32frames, Kinetics pretrained, single)#25Top 1 Accuracy: 54.59Top 5 Accuracy: 82.30Param.: 5.8M
action-recognition-in-videos-on-something-1VoV3D-M (32frames, Kinetics pretrained, single)#34Top 1 Accuracy: 52.68Top 5 Accuracy: 80.43Param.: 3.3M
action-recognition-in-videos-on-something-1VoV3D-L (32frames, from scratch, single)#42Top 1 Accuracy: 50.6Top 5 Accuracy: 78.7Param.: 5.8MGFLOPs: 20.9x6
action-recognition-in-videos-on-something-1VoV3D-M (32frames, from scratch, single)#44Top 1 Accuracy: 49.8Top 5 Accuracy: 78.0Param.: 3.3MGFLOPs: 11.5x6
action-recognition-in-videos-on-something-1VoV3D-L (16frames, from scratch, single)#46Top 1 Accuracy: 49.5Top 5 Accuracy: 78.0Param.: 5.8MGFLOPs: 9.3x6
action-recognition-in-videos-on-something-1VoV3D-M (16frames, from scratch, single)#52Top 1 Accuracy: 48.1Top 5 Accuracy: 76.9Param.: 3.3MGFLOPs: 5.7x6