Learning Self-Similarity in Space and Time as Generalized Motion for Video Action Recognition

Benchmark Model Rank Results
action-recognition-in-videos-on-somethingSELFYNet-TSM-R50En (8+16 frames, ImageNet pretrained, 2 clips)#54Top-1 Accuracy: 67.7Top-5 Accuracy: 91.1
action-recognition-in-videos-on-somethingSELFYNet-TSM-R50En (8+16 frames, ImageNet pretrained, a single clip)#56Top-1 Accuracy: 67.4Top-5 Accuracy: 91
action-recognition-in-videos-on-somethingSELFYNet-TSM-R50 (16 frames, ImageNet pretrained)#73Top-1 Accuracy: 65.7Top-5 Accuracy: 89.8
action-recognition-in-videos-on-something-1SELFYNet-TSM-R50En (8+16 frames, ImageNet pretrained, 2 clips)#17Top 1 Accuracy: 56.6Top 5 Accuracy: 84.4
action-recognition-in-videos-on-something-1SELFYNet-TSM-R50En (8+16 frames, ImageNet pretrained, a single clip)#20Top 1 Accuracy: 55.8Top 5 Accuracy: 83.9
action-recognition-in-videos-on-something-1SELFYNet-TSM-R50 (16 frames, ImageNet pretrained)#27Top 1 Accuracy: 54.3Top 5 Accuracy: 82.9