Audio-Visual Instance Discrimination with Cross-Modal Agreement

Benchmark Model Rank Results
audio-classification-on-esc-50AVID#19Top-1 Accuracy: 89.2
self-supervised-action-recognition-on-hmdb51AVID+CMA (Modified R2+1D-18 on Audioset)#16Top-1 Accuracy: 64.7Pre-Training Dataset: Audioset (Video+Audio)
self-supervised-action-recognition-on-hmdb51AVID (Modified R2+1D-18 on Audioset)#19Top-1 Accuracy: 64.1Pre-Training Dataset: Audioset (Video+Audio)
self-supervised-action-recognition-on-hmdb51AVID+CMA (Modified R2+1D-18 on Kinetics)#24Top-1 Accuracy: 60.8Pre-Training Dataset: Kinetics400 (Video+Audio)
self-supervised-action-recognition-on-hmdb51AVID (Modified R2+1D-18 on Kinetics)#26Top-1 Accuracy: 59.9Pre-Training Dataset: Kinetics400 (Video+Audio)
self-supervised-action-recognition-on-hmdb51-1AVID#7Top-1 Accuracy: 64.7
self-supervised-action-recognition-on-ucf101AVID+CMA (Modified R2+1D-18 on Audioset)#173-fold Accuracy: 91.5Pre-Training Dataset: Audioset (Audio+Video)
self-supervised-action-recognition-on-ucf101AVID (Modified R2+1D-18 on Audioset)#203-fold Accuracy: 91.0Pre-Training Dataset: Audioset (Audio+Video)
self-supervised-action-recognition-on-ucf101AVID+CMA (Modified R2+1D-18 on Kinetics)#253-fold Accuracy: 87.5Pre-Training Dataset: Kinetics400 (Audio+Video)
self-supervised-action-recognition-on-ucf101AVID (Modified R2+1D-18 on Kinetics)#263-fold Accuracy: 86.9Pre-Training Dataset: Kinetics400 (Audio+Video)
self-supervised-action-recognition-on-ucf101-1AVID#63-fold Accuracy: 91.5