Relational Self-Attention: What's Missing in Attention for Video Understanding

Benchmark Model Rank Results
action-recognition-in-videos-on-somethingRSANet-R50 (8+16 frames, ImageNet pretrained, 2 clips#55Top-1 Accuracy: 67.7Top-5 Accuracy: 91.1
action-recognition-in-videos-on-somethingRSANet-R50 (8+16 frames, ImageNet pretrained, a single clip)#58Top-1 Accuracy: 67.3Top-5 Accuracy: 90.8
action-recognition-in-videos-on-somethingRSANet-R50 (16 frames, ImageNet pretrained, a single clip)#71Top-1 Accuracy: 66Top-5 Accuracy: 89.8
action-recognition-in-videos-on-somethingRSANet-R50 (8 frames, ImageNet pretrained, a single clip)#80Top-1 Accuracy: 64.8Top-5 Accuracy: 89.1
action-recognition-in-videos-on-somethingRSANet-R50 (8+16 frames, ImageNet pretrained, 2 clips)#101Top-5 Accuracy: 91.1
action-recognition-in-videos-on-something-1RSANet-R50 (8+16 frames, ImageNet pretrained, 2 clips)#19Top 1 Accuracy: 56.1Top 5 Accuracy: 82.8
action-recognition-in-videos-on-something-1RSANet-R50 (8+16 frames, ImageNet pretrained, a single clip)#21Top 1 Accuracy: 55.5Top 5 Accuracy: 82.6
action-recognition-in-videos-on-something-1RSANet-R50 (16 frames, ImageNet pretrained, a single clip)#30Top 1 Accuracy: 54.0Top 5 Accuracy: 81.1
action-recognition-in-videos-on-something-1RSANet-R50 (8 frames, ImageNet pretrained, a single clip)#37Top 1 Accuracy: 51.9Top 5 Accuracy: 79.6
action-recognition-on-diving-48RSANet-R50 (16 frames, ImageNet pretrained, a single clip)#9Accuracy: 84.2