Co-training Transformer with Videos and Images Improves Action Recognition

Benchmark Model Rank Results
action-classification-on-kinetics-400CoVeR (JFT-300M)Acc@1: 86.3Acc@5: 97.2
action-classification-on-kinetics-400CoVeR (JFT-3B)Acc@1: 87.2Acc@5: 97.5
action-classification-on-kinetics-600CoVeR (JFT-300M)Top-1 Accuracy: 86.8Top-5 Accuracy: 97.3
action-classification-on-kinetics-600CoVeR (JFT-3B)Top-1 Accuracy: 87.9Top-5 Accuracy: 97.8
action-classification-on-kinetics-700CoVeR (JFT-300M)Top-1 Accuracy: 78.5Top-5 Accuracy: 94.2
action-classification-on-kinetics-700CoVeR (JFT-3B)Top-1 Accuracy: 79.8Top-5 Accuracy: 94.9
action-classification-on-moments-in-timeCoVeR(JFT-300M)Top 1 Accuracy: 45.0Top 5 Accuracy: 73.9
action-classification-on-moments-in-timeCoVeR(JFT-3B)Top 1 Accuracy: 46.1Top 5 Accuracy: 75.4
action-recognition-in-videos-on-somethingCoVeR(JFT-300M)Top-1 Accuracy: 69.8Top-5 Accuracy: 91.9
action-recognition-in-videos-on-somethingCoVeR(JFT-3B)Top-1 Accuracy: 70.9Top-5 Accuracy: 92.5