| Benchmark | Model | Rank | Results |
|---|---|---|---|
| audio-captioning-on-clotho | Qwen-Audio | #5 | SPIDEr: 0.288CIDEr: 0.441SPICE: 0.136 |
| emotion-recognition-in-conversation-on-meld | Qwen-Audio | #44 | Accuracy: 55.70 |
| speech-recognition-on-aishell-1 | Qwen-Audio | #2 | Word Error Rate (WER): 1.29 |
| speech-recognition-on-librispeech-test-clean | Qwen-Audio | #71 | Word Error Rate (WER): 2.0 |
| speech-recognition-on-librispeech-test-other | Qwen-Audio | #65 | Word Error Rate (WER): 4.2 |