VicTR: Video-conditioned Text Representations for Activity Recognition

Benchmark Model Rank Results
action-classification-on-charadesVicTR (ViT-L/14)MAP: 57.6
action-classification-on-kinetics-400VicTR (ViT-L/14)Acc@1: 87.0
zero-shot-action-recognition-on-hmdb51VicTR (ViT-B/16)Top-1 Accuracy: 51.0
zero-shot-action-recognition-on-ucf101VicTR (ViT-B/16)Top-1 Accuracy: 72.4