EAT: Self-Supervised Pre-Training with Efficient Audio Transformer

Benchmark Model Rank Results
audio-classification-on-audiosetEAT#15Test mAP: 0.486
audio-classification-on-balanced-audio-setEAT#3Mean AP: 40.3
audio-classification-on-esc-50EAT#11Top-1 Accuracy: 96.0PRE-TRAINING DATASET: AudioSet…
audio-classification-on-speech-commandsEAT#1Accuracy: 98.3±0.04