SSAST: Self-Supervised Audio Spectrogram Transformer

Benchmark Model Rank Results
audio-classification-on-balanced-audio-setSSAST-PATCH#6Mean AP: 31.0
audio-classification-on-balanced-audio-setSSAST-FRAME#7Mean AP: 29.2
audio-classification-on-esc-50SSAST 400#20Top-1 Accuracy: 88.8PRE-TRAINING DATASET: AudioSet, Librispeech
speaker-identification-on-voxceleb1SSAST-FRAME#9Top-1 (%): 80.8Accuracy: 80.8
speaker-identification-on-voxceleb1SSAST-PATCH#11Top-1 (%): 64.2Accuracy: 64.2