Just Add $π$! Pose Induced Video Transformers for Understanding Activities of Daily Living

Benchmark Model Rank Results
action-classification-on-toyota-smarthomeπ-ViT#1CS: 72.9CV1: 55.2CV2: 64.8
action-recognition-in-videos-on-ntu-rgbd-120π-ViT (RGB + Pose)#3Accuracy (Cross-Setup): 96.1Accuracy (Cross-Subject): 95.1
action-recognition-in-videos-on-ntu-rgbd-120π-ViT (RGB only)#7Accuracy (Cross-Setup): 91.9Accuracy (Cross-Subject): 92.9
action-recognition-in-videos-on-ntu-rgbd-60π-ViT (RGB + Pose)#3Accuracy (CS): 96.3Accuracy (CV): 99.0
action-recognition-in-videos-on-ntu-rgbd-60π-ViT (RGB only)#9Accuracy (CS): 94.0Accuracy (CV): 97.9