On the Effects of Heterogeneous Data Sources on Speech-to-Text Foundation Models

Benchmark Model Rank Results
speech-recognition-on-amiespnet/owsm_ctc_v3.2_ft_1B#44Word Error Rate (WER): 15.96
speech-recognition-on-ami-cleanedespnet/owsm_ctc_v3.2_ft_1B#43Word Error Rate (WER): 13.88
speech-recognition-on-earnings-22espnet/owsm_ctc_v3.2_ft_1B#37Word Error Rate (WER): 12.82
speech-recognition-on-gigaspeech-cleanedespnet/owsm_ctc_v3.2_ft_1B#47Word Error Rate (WER): 10.14
speech-recognition-on-gigaspeech-testespnet/owsm_ctc_v3.2_ft_1B#48Word Error Rate (WER): 10.29
speech-recognition-on-librispeech-test-cleanespnet/owsm_ctc_v3.2_ft_1B#83Word Error Rate (WER): 2.17
speech-recognition-on-librispeech-test-otherespnet/owsm_ctc_v3.2_ft_1B#79Word Error Rate (WER): 4.82
speech-recognition-on-spgispeechespnet/owsm_ctc_v3.2_ft_1B#19Word Error Rate (WER): 2.47
speech-recognition-on-voxpopuliespnet/owsm_ctc_v3.2_ft_1B#40Word Error Rate (WER): 7.75
speech-recognition-on-voxpopuli-cleanedespnet/owsm_ctc_v3.2_ft_1B#49Word Error Rate (WER): 4.45