Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models

Benchmark Model Rank Results
audio-captioning-on-clothoQwen-Audio#5SPIDEr: 0.288CIDEr: 0.441SPICE: 0.136
emotion-recognition-in-conversation-on-meldQwen-Audio#44Accuracy: 55.70
speech-recognition-on-aishell-1Qwen-Audio#2Word Error Rate (WER): 1.29
speech-recognition-on-librispeech-test-cleanQwen-Audio#71Word Error Rate (WER): 2.0
speech-recognition-on-librispeech-test-otherQwen-Audio#65Word Error Rate (WER): 4.2