Hulk: A Universal Knowledge Translator for Human-Centric Tasks

Benchmark Model Rank Results
3d-human-pose-estimation-on-3dpwHulk(ViT-L)#4MPVPE: 77.4PA-MPJPE: 38.5MPJPE: 66.3
3d-human-pose-estimation-on-3dpwHulk(ViT-B)#9MPVPE: 79.8PA-MPJPE: 39.9MPJPE: 67
human-part-segmentation-on-cihpHulk(Finetune, ViT-L)#1Mean IoU: 72.68
human-part-segmentation-on-cihpHulk(Finetune, ViT-B)#2Mean IoU: 71.26
human-part-segmentation-on-human3-6mHulk(Finetune, ViT-L)#1mIoU: 69.89
human-part-segmentation-on-human3-6mHulk(Finetune, ViT-B)#2mIoU: 68.56
object-detection-on-crowdhuman-full-bodyHulk(Finetune, ViT-L)#6AP: 93mMR: 36.5
object-detection-on-crowdhuman-full-bodyHulk(Finetune, ViT-B)#9AP: 92.4mMR: 40.7
pedestrian-attribute-recognition-on-pa-100kHulk(Finetune, ViT-L)#2Accuracy: 88.97
pedestrian-attribute-recognition-on-pa-100kHulk(Finetune, ViT-B)#3Accuracy: 87.85
pedestrian-attribute-recognition-on-rapv2Hulk(Finetune, ViT-L)#1Accuracy: 85.86
pedestrian-attribute-recognition-on-rapv2Hulk(Finetune, ViT-B)#2Accuracy: 85.26
pose-estimation-on-aicHulk(Finetune, ViT-L)#1AP: 37.1
pose-estimation-on-aicHulk(Finetune, ViT-B)#2AP: 35.6
pose-estimation-on-cocoHulk(Finetune, ViT-L)#3AP: 78.7
pose-estimation-on-cocoHulk(Finetune, ViT-B)#5AP: 77.5
semantic-segmentation-on-lip-valHulk(Finetune, ViT-L)#1mIoU: 66.02%
semantic-segmentation-on-lip-valHulk(Finetune, ViT-B)#2mIoU: 63.98%
skeleton-based-action-recognition-on-ntu-rgbd-60Hulk(Finetune, ViT-L)#4Accuracy (CS): 94.3
skeleton-based-action-recognition-on-ntu-rgbd-60Hulk(Finetune, ViT-B)#6Accuracy (CS): 94