Cooperative Learning of Audio and Video Models from Self-Supervised Synchronization

Benchmark Model Rank Results
audio-classification-on-esc-50AVTSTop-1 Accuracy: 82.3
self-supervised-action-recognition-on-hmdb51-1AVTSTop-1 Accuracy: 61.6
self-supervised-action-recognition-on-ucf101-1AVTS3-fold Accuracy: 89.0