Learning Spatio-Temporal Representation with Local and Global Diffusion

Benchmark Model Rank Results
action-classification-on-kinetics-400LGD-3D Flow (ResNet-101)Acc@1: 72.3Acc@5: 90.9
action-classification-on-kinetics-400LGD-3D RGB (ResNet-101)Acc@1: 79.4Acc@5: 94.4
action-classification-on-kinetics-400LGD-3D Two-stream (ResNet-101)Acc@1: 81.2Acc@5: 95.2
action-classification-on-kinetics-600LGD-3D FlowTop-1 Accuracy: 75Top-5 Accuracy: 92.4
action-classification-on-kinetics-600LGD-3D RGBTop-1 Accuracy: 81.5Top-5 Accuracy: 95.6
action-classification-on-kinetics-600LGD-3D Two-streamTop-1 Accuracy: 83.1Top-5 Accuracy: 96.2
action-recognition-in-videos-on-hmdb-51LGD-3D FlowAverage accuracy of 3 splits: 78.9
action-recognition-in-videos-on-hmdb-51LGD-3D RGBAverage accuracy of 3 splits: 75.7
action-recognition-in-videos-on-hmdb-51LGD-3D Two-streamAverage accuracy of 3 splits: 80.5
action-recognition-in-videos-on-ucf101LGD-3D Flow3-fold Accuracy: 96.8
action-recognition-in-videos-on-ucf101LGD-3D RGB3-fold Accuracy: 97
action-recognition-in-videos-on-ucf101LGD-3D Two-stream3-fold Accuracy: 98.2