| action-classification-on-kinetics-400 | Text4Vis (CLIP ViT-L/14) | #26 | Acc@1: 87.8Acc@5: 97.6 |
| action-recognition-in-videos-on-activitynet | Text4Vis (w/ ViT-L) | #1 | mAP: 96.9 |
| action-recognition-in-videos-on-ucf101 | Text4Vis | #5 | 3-fold Accuracy: 98.2 |
| zero-shot-action-recognition-on-activitynet | Text4Vis | #2 | Top-1 Accuracy: 84.6 |
| zero-shot-action-recognition-on-hmdb51 | Text4Vis | #3 | Top-1 Accuracy: 58.4 |
| zero-shot-action-recognition-on-kinetics | Text4Vis | #5 | Top-1 Accuracy: 68.9Top-5 Accuracy: 90.3 |
| zero-shot-action-recognition-on-ucf101 | Text4Vis | #3 | Top-1 Accuracy: 85.8 |