AVA: A Video Dataset of Spatio-temporally Localized Atomic Visual Actions

Benchmark Model Rank Results
action-detection-on-j-hmdbFaster-RCNN + two-stream I3D conv#6Frame-mAP 0.5: 73.3Video-mAP 0.5: 78.6
action-detection-on-ucf101-24Faster-RCNN + two-stream I3D conv#6Frame-mAP 0.5: 76.3Video-mAP 0.5: 59.9
action-recognition-in-videos-on-ava-v21S3D-G w/ ResNet RPN (Kinetics-400 pretraining(#9mAP (Val): 22.0