OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning

Benchmark Model Rank Results
speech-recognition-on-amiespnet/owsm_ctc_v4_1B#21Word Error Rate (WER): 12.58
speech-recognition-on-ami-cleanedespnet/owsm_ctc_v4_1B#22Word Error Rate (WER): 11.11
speech-recognition-on-earnings-22espnet/owsm_ctc_v4_1B#44Word Error Rate (WER): 13.37
speech-recognition-on-gigaspeech-cleanedespnet/owsm_ctc_v4_1B#44Word Error Rate (WER): 9.29
speech-recognition-on-gigaspeech-testespnet/owsm_ctc_v4_1B#42Word Error Rate (WER): 9.37
speech-recognition-on-librispeech-test-cleanespnet/owsm_ctc_v4_1B#78Word Error Rate (WER): 2.1
speech-recognition-on-librispeech-test-otherespnet/owsm_ctc_v4_1B#69Word Error Rate (WER): 4.37
speech-recognition-on-spgispeechespnet/owsm_ctc_v4_1B#17Word Error Rate (WER): 2.31
speech-recognition-on-voxpopuliespnet/owsm_ctc_v4_1B#34Word Error Rate (WER): 7.12
speech-recognition-on-voxpopuli-cleanedespnet/owsm_ctc_v4_1B#36Word Error Rate (WER): 4.09