MetaAudio: A Few-Shot Audio Classification Benchmark

Benchmark Model Rank Results
few-shot-audio-classification-onMAML (CRNN)#1Top-1 Accuracy(5-Way-1-Shot): 43.45 +- 0.46
few-shot-audio-classification-onMeta-Curvature (CRNN)#2Top-1 Accuracy(5-Way-1-Shot): 43.18 +- 0.45
few-shot-audio-classification-onSimpleShot CL2N (CRNN)#3Top-1 Accuracy(5-Way-1-Shot): 42.05 +- 0.42
few-shot-audio-classification-onMeta-Baseline (CRNN)#4Top-1 Accuracy(5-Way-1-Shot): 40.27 +- 0.44
few-shot-audio-classification-onPrototypical Networks (CRNN)#5Top-1 Accuracy(5-Way-1-Shot): 39.44 +- 0.44
few-shot-audio-classification-onSimpleShot CL2N (AST ImageNet & AudioSet- No fine-tune)#7Top-1 Accuracy(5-Way-1-Shot): 38.78 +- 0.41
few-shot-audio-classification-onSimpleShot CL2N (AST ImageNet - No fine-tune)#9Top-1 Accuracy(5-Way-1-Shot): 33.52 +- 0.39
few-shot-audio-classification-on-birdclefMeta-Curvature (CRNN)#1Top-1 Accuracy(5-Way-1-Shot): 61.34 +- 0.46
few-shot-audio-classification-on-birdclefSimpleShot Cl2N (CRNN)#2Top-1 Accuracy(5-Way-1-Shot): 57.66 +- 0.43
few-shot-audio-classification-on-birdclefMeta-Baseline (CRNN)#3Top-1 Accuracy(5-Way-1-Shot): 57.28 +- 0.41
few-shot-audio-classification-on-birdclefMAML (CRNN)#4Top-1 Accuracy(5-Way-1-Shot): 56.26 +- 0.45
few-shot-audio-classification-on-birdclefPrototypical Networks (CRNN)#5Top-1 Accuracy(5-Way-1-Shot): 56.11 +- 0.46
few-shot-audio-classification-on-birdclefSimpleShot CL2N (AST ImageNet & AudioSet- No fine-tune)#6Top-1 Accuracy(5-Way-1-Shot): 36.41 +- 0.42
few-shot-audio-classification-on-birdclefSimpleShot CL2N (AST ImageNet - No fine-tune)#7Top-1 Accuracy(5-Way-1-Shot): 33.04 +- 0.41
few-shot-audio-classification-on-esc-50Meta-Curvature (CRNN)#1Top-1 Accuracy(5-Way-1-Shot): 76.17 +- 0.41
few-shot-audio-classification-on-esc-50MAML (CRNN)#2Top-1 Accuracy(5-Way-1-Shot): 74.66 ± 0.42
few-shot-audio-classification-on-esc-50Meta-Baseline (CRNN)#3Top-1 Accuracy(5-Way-1-Shot): 71.72 +- 0.38
few-shot-audio-classification-on-esc-50Prototypical Networks (CRNN)#5Top-1 Accuracy(5-Way-1-Shot): 68.83 +- 0.38
few-shot-audio-classification-on-esc-50SimpleShot CL2N (CRNN)#6Top-1 Accuracy(5-Way-1-Shot): 68.82 +-0.39
few-shot-audio-classification-on-esc-50SimpleShot CL2N (AST ImageNet & AudioSet- No fine-tune)#7Top-1 Accuracy(5-Way-1-Shot): 64.48 +- 0.41
few-shot-audio-classification-on-esc-50SimpleShot CL2N (AST ImageNet - No fine-tune)#9Top-1 Accuracy(5-Way-1-Shot): 60.41 +- 0.41
few-shot-audio-classification-on-nsynthMeta-Curvature (CRNN)#1Top-1 Accuracy(5-Way-1-Shot): 96.47 +-0.19
few-shot-audio-classification-on-nsynthPrototypical Networks (CRNN)#2Top-1 Accuracy(5-Way-1-Shot): 95.23 +- 0.19
few-shot-audio-classification-on-nsynthMAML (CRNN)#3Top-1 Accuracy(5-Way-1-Shot): 93.85 +- 0.24
few-shot-audio-classification-on-nsynthMeta-Baseline (CRNN)#4Top-1 Accuracy(5-Way-1-Shot): 90.74 +- 0.25
few-shot-audio-classification-on-nsynthSimpleShot CL2N (CRNN)#5Top-1 Accuracy(5-Way-1-Shot): 90.04 +- 0.27
few-shot-audio-classification-on-nsynthSimpleShot CL2N Classifier (AST pre-trained w/ ImageNet - No fine-tune)#7Top-1 Accuracy(5-Way-1-Shot): 66.68 +- 0.41
few-shot-audio-classification-on-nsynthSimpleShot CL2N Classifier (AST ImageNet & AudioSet - No fine-tune)#9Top-1 Accuracy(5-Way-1-Shot): 63.78 +- 0.42
few-shot-audio-classification-on-voxceleb1Meta-Curvature (CRNN)#1Top-1 Accuracy(5-Way-1-Shot): 63.85 +- 0.44
few-shot-audio-classification-on-voxceleb1MAML (CRNN)#2Top-1 Accuracy(5-Way-1-Shot): 60.89 +- 0.45
few-shot-audio-classification-on-voxceleb1Prototypical Networks (CRNN)#3Top-1 Accuracy(5-Way-1-Shot): 59.64 +- 0.44
few-shot-audio-classification-on-voxceleb1Meta-Baseline (CRNN)#4Top-1 Accuracy(5-Way-1-Shot): 55.54 +- 0.42
few-shot-audio-classification-on-voxceleb1SimpleShot CL2N (CRNN)#5Top-1 Accuracy(5-Way-1-Shot): 48.50 +- 0.42
few-shot-audio-classification-on-voxceleb1SimpleShot CL2N (AST ImageNet & AudioSet- No fine-tune)#8Top-1 Accuracy(5-Way-1-Shot): 28.79 +- 0.38
few-shot-audio-classification-on-voxceleb1SimpleShot CL2N (AST ImageNet - No fine-tune)#9Top-1 Accuracy(5-Way-1-Shot): 28.09 +- 0.37
few-shot-audio-classification-on-watkinsSimpleShot CL2N (AST ImageNet - No fine-tune)#2Top-1 Accuracy(5-Way-1-Shot): 55.40 ± 0.42
few-shot-audio-classification-on-watkinsSimpleShot CL2N (AST ImageNet & AudioSet- No fine-tune)#4Top-1 Accuracy(5-Way-1-Shot): 51.81 ± 0.42