| audio-classification-on-audioset | AST (Ensemble) | #17 | Test mAP: 0.485 |
| audio-classification-on-audioset | AST (Single) | #31 | Test mAP: 0.459 |
| audio-classification-on-esc-50 | AST-P | #13 | Top-1 Accuracy: 95.6PRE-TRAINING DATASET: AudioSet, ImageNet… |
| audio-classification-on-esc-50 | AST-S | #21 | Top-1 Accuracy: 88.7PRE-TRAINING DATASET: ImageNet… |
| audio-classification-on-speech-commands-1 | AST-S | #2 | Accuracy: 98.11±0.05 |
| audio-tagging-on-audioset | Audio Spectrogram Transformer | #9 | mean average precision: 0.485 |
| keyword-spotting-on-google-speech-commands | Audio Spectrogram Transformer | #26 | Google Speech Commands V2 35: 98.11 |
| speech-emotion-recognition-on-crema-d | ViT | #4 | Accuracy: 67.81 |
| time-series-on-speech-commands | ViT | #2 | % Test Accuracy: 98.11 |