Revisiting Classifier: Transferring Vision-Language Models for Video Recognition

Benchmark Model Rank Results
action-classification-on-kinetics-400Text4Vis (CLIP ViT-L/14)#26Acc@1: 87.8Acc@5: 97.6
action-recognition-in-videos-on-activitynetText4Vis (w/ ViT-L)#1mAP: 96.9
action-recognition-in-videos-on-ucf101Text4Vis#53-fold Accuracy: 98.2
zero-shot-action-recognition-on-activitynetText4Vis#2Top-1 Accuracy: 84.6
zero-shot-action-recognition-on-hmdb51Text4Vis#3Top-1 Accuracy: 58.4
zero-shot-action-recognition-on-kineticsText4Vis#5Top-1 Accuracy: 68.9Top-5 Accuracy: 90.3
zero-shot-action-recognition-on-ucf101Text4Vis#3Top-1 Accuracy: 85.8