Self-Supervised Learning by Cross-Modal Audio-Video Clustering

Benchmark Model Rank Results
audio-classification-on-dcaseXDC#3Top-1 Accuracy: 95PRE-TRAINING DATASET: IG-Random
audio-classification-on-dcaseXDC#4Top-1 Accuracy: 95PRE-TRAINING DATASET: AudioSet
audio-classification-on-esc-50XDC#23Top-1 Accuracy: 85.4PRE-TRAINING DATASET: IG-Random
audio-classification-on-esc-50XDC#24Top-1 Accuracy: 84.8PRE-TRAINING DATASET: AudioSet
self-supervised-action-recognition-on-hmdb51XDC#9Top-1 Accuracy: 68.9Pre-Training Dataset: IG-KineticsFrozen: false
self-supervised-action-recognition-on-hmdb51XDC#13Top-1 Accuracy: 66.5Pre-Training Dataset: IG-RandomFrozen: false
self-supervised-action-recognition-on-hmdb51XDC#20Top-1 Accuracy: 63.7Pre-Training Dataset: AudioSetFrozen: false
self-supervised-action-recognition-on-hmdb51XDC#29Top-1 Accuracy: 52.6Pre-Training Dataset: Kinetics400Frozen: false
self-supervised-action-recognition-on-hmdb51-1XDC#4Top-1 Accuracy: 68.9
self-supervised-action-recognition-on-ucf101-1XDC#23-fold Accuracy: 95.5