Efficient Training of Audio Transformers with Patchout

Benchmark Model Rank Results
audio-classification-on-audiosetPaSST (Ensemble)#10Test mAP: 0.496
audio-classification-on-audiosetPaSST-S (Single)#28Test mAP: 0.471
audio-classification-on-esc-50PaSST-S#9Top-1 Accuracy: 96.8PRE-TRAINING DATASET: AudioSet
audio-classification-on-fsd50kPaSST-S#3mAP: 65.55
audio-classification-on-fsd50kPaSST-N-S#5mAP: 64.2
audio-tagging-on-audiosetPaSST#6mean average precision: 0.496
instrument-recognition-on-openmic-2018PaSST#5mean average precision: 0.843