VidTr: Video Transformer Without Convolutions

Benchmark Model Rank Results
action-classification-on-charadesEn-VidTr-LMAP: 47.3
action-classification-on-charadesVidTr-LMAP: 43.5
action-classification-on-kinetics-400En-VidTr-LAcc@1: 80.5Acc@5: 94.6
action-classification-on-kinetics-400En-VidTr-MAcc@1: 79.7Acc@5: 94.2
action-classification-on-kinetics-400En-VidTr-SAcc@1: 79.4Acc@5: 94
action-classification-on-kinetics-700En-VidTr-LTop-1 Accuracy: 70.8Top-5 Accuracy: 89.4
action-classification-on-kinetics-700VidTr-LTop-1 Accuracy: 70.2Top-5 Accuracy: 89
action-classification-on-kinetics-700VidTr-MTop-1 Accuracy: 69.5Top-5 Accuracy: 88.3
action-classification-on-kinetics-700VidTr-STop-1 Accuracy: 67.3Top-5 Accuracy: 87.7
action-recognition-in-videos-on-hmdb-51VidTr-LAverage accuracy of 3 splits: 74.4
action-recognition-in-videos-on-somethingVidTr-LTop-1 Accuracy: 60.2
action-recognition-in-videos-on-ucf101VidTr-L3-fold Accuracy: 96.7