OST: Refining Text Knowledge with Optimal Spatio-Temporal Descriptor for General Video Recognition

Benchmark Model Rank Results
zero-shot-action-recognition-on-hmdb51OST#5Top-1 Accuracy: 55.9
zero-shot-action-recognition-on-kineticsOST#2Top-1 Accuracy: 75.1Top-5 Accuracy: 94.6
zero-shot-action-recognition-on-ucf101OST#6Top-1 Accuracy: 79.7