ST-Adapter: Parameter-Efficient Image-to-Video Transfer Learning

Benchmark Model Rank Results
action-classification-on-kinetics-400ST-Adapter (ViT-L, CLIP)#33Acc@1: 87.2Acc@5: 97.6
action-recognition-in-videos-on-somethingST-Adapter (ViT-L, CLIP)#23Top-1 Accuracy: 72.3Top-5 Accuracy: 93.9GFLOPs: 8248