Multimodal Open-Vocabulary Video Classification via Pre-Trained Vision and Language Models

Benchmark Model Rank Results
zero-shot-action-recognition-on-hmdb51MOV (ViT-B/16)Top-1 Accuracy: 60.8
zero-shot-action-recognition-on-hmdb51MOV (ViT-L/14)Top-1 Accuracy: 64.7
zero-shot-action-recognition-on-ucf101MOV (ViT-B/16)Top-1 Accuracy: 82.6
zero-shot-action-recognition-on-ucf101MOV (ViT-L/14)Top-1 Accuracy: 87.1