Masked Modeling Duo: Towards a Universal Audio Pre-training Framework

Benchmark Model Rank Results
audio-classification-on-audio-setM2D-AS/0.7#1Mean AP: 48.5
audio-classification-on-audiosetM2D-AS/0.7#18Test mAP: 0.485
audio-classification-on-audiosetM2D/0.7#23Test mAP: 0.479
audio-classification-on-esc-50M2D-AS/0.7#7Top-1 Accuracy: 97.2PRE-TRAINING DATASET: AudioSet
audio-classification-on-esc-50M2D/0.7#12Top-1 Accuracy: 96.0Accuracy (5-fold): 96.0
audio-classification-on-icbhi-respiratoryM2D-X/0.7 (η=0.3)#5ICBHI Score: 63.29
audio-classification-on-icbhi-respiratoryM2D/0.7 (e=0.3)#7ICBHI Score: 62.73
speaker-identification-on-voxceleb1MSM-MAE#1Top-1 (%): 96.6Accuracy: 96.6
speaker-identification-on-voxceleb1M2D/0.6#2Top-1 (%): 96.5Accuracy: 96.5
speaker-identification-on-voxceleb1M2D/0.7#3Top-1 (%): 96.3Accuracy: 96.3