Implicit Temporal Modeling with Learnable Alignment for Video Recognition

Benchmark Model Rank Results
action-classification-on-kinetics-400ILA (ViT-L/14)#18Acc@1: 88.7Acc@5: 97.8
action-classification-on-kinetics-400ILA (ViT-B/16)#45Acc@1: 85.7Acc@5: 97.2
action-classification-on-kinetics-400ILA (ViT-B/32)#70Acc@1: 82.4Acc@5: 95.8
action-recognition-in-videos-on-somethingILA (ViT-L/14)#34Top-1 Accuracy: 70.2Top-5 Accuracy: 91.8
action-recognition-in-videos-on-somethingILA (ViT-B/16)#64Top-1 Accuracy: 66.8Top-5 Accuracy: 90.3