ZeroI2V: Zero-Cost Adaptation of Pre-trained Transformers from Image to Video

Benchmark Model Rank Results
action-classification-on-kinetics-400ZeroI2V ViT-L/14#35Acc@1: 87.2Acc@5: 97.6
action-recognition-in-videos-on-hmdb-51ZeroI2V ViT-L/14#7Average accuracy of 3 splits: 83.4
action-recognition-in-videos-on-somethingZeroI2V ViT-L/14#24Top-1 Accuracy: 72.2Top-5 Accuracy: 93.0
action-recognition-in-videos-on-ucf101ZeroI2V ViT-L/14#43-fold Accuracy: 98.6