Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models

Benchmark Model Rank Results
action-classification-on-charadesBIKE#8MAP: 50.7
action-classification-on-kinetics-400BIKE (CLIP ViT-L/14)#17Acc@1: 88.7Acc@5: 98.4
action-recognition-in-videos-on-activitynetBIKE#2mAP: 96.1
action-recognition-in-videos-on-hmdb-51BIKE#8Average accuracy of 3 splits: 83.1
action-recognition-in-videos-on-ucf101BIKE#23-fold Accuracy: 98.8
zero-shot-action-recognition-on-activitynetBIKE#1Top-1 Accuracy: 86.2
zero-shot-action-recognition-on-hmdb51BIKE#2Top-1 Accuracy: 61.4
zero-shot-action-recognition-on-kineticsBIKE#6Top-1 Accuracy: 68.5Top-5 Accuracy: 91.1
zero-shot-action-recognition-on-ucf101BIKE#2Top-1 Accuracy: 86.6