OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification

Benchmark Model Rank Results
speech-recognition-on-amiespnet/owsm_ctc_v3.1_1B#35Word Error Rate (WER): 15.18
speech-recognition-on-ami-cleanedespnet/owsm_ctc_v3.1_1B#35Word Error Rate (WER): 13.35
speech-recognition-on-earnings-22espnet/owsm_ctc_v3.1_1B#43Word Error Rate (WER): 13.28
speech-recognition-on-gigaspeech-cleanedespnet/owsm_ctc_v3.1_1B#49Word Error Rate (WER): 10.35
speech-recognition-on-gigaspeech-testespnet/owsm_ctc_v3.1_1B#50Word Error Rate (WER): 10.44
speech-recognition-on-librispeech-test-cleanespnet/owsm_ctc_v3.1_1B#64Word Error Rate (WER): 1.9
speech-recognition-on-librispeech-test-otherespnet/owsm_ctc_v3.1_1B#75Word Error Rate (WER): 4.65
speech-recognition-on-spgispeechespnet/owsm_ctc_v3.1_1B#26Word Error Rate (WER): 2.64
speech-recognition-on-voxpopuliespnet/owsm_ctc_v3.1_1B#47Word Error Rate (WER): 8.11
speech-recognition-on-voxpopuli-cleanedespnet/owsm_ctc_v3.1_1B#53Word Error Rate (WER): 4.58