Expanding Language-Image Pretrained Models for General Video Recognition

Benchmark Model Rank Results
action-classification-on-kinetics-400X-CLIP(ViT-L/14, CLIP)#28Acc@1: 87.7Acc@5: 97.4
action-classification-on-kinetics-600X-CLIP(ViT-L/14, CLIP)#18Top-1 Accuracy: 88.3Top-5 Accuracy: 97.7
zero-shot-action-recognition-on-hmdb51X-CLIP#8Top-1 Accuracy: 44.6
zero-shot-action-recognition-on-kineticsX-CLIP#7Top-1 Accuracy: 65.2Top-5 Accuracy: 86.1
zero-shot-action-recognition-on-ucf101X-CLIP#10Top-1 Accuracy: 72.0