End-to-End Spatio-Temporal Action Localisation with Video Transformers

Benchmark Model Rank Results
action-detection-on-ucf101-24STAR/LFrame-mAP 0.5: 90.3Video-mAP 0.2: 88.0Video-mAP 0.5: 71.8
action-recognition-in-videos-on-ava-v21STAR/LmAP (Val): 41.7
action-recognition-on-ava-v2-2STAR/LmAP: 41.7
spatio-temporal-action-localization-on-avaSTAR/Lval mAP: 41.7