Streaming Sequence-to-Sequence Learning with Delayed Streams Modeling

Benchmark Model Rank Results
speech-recognition-on-amikyutai/stt-2.6b-en#17Word Error Rate (WER): 11.57
speech-recognition-on-ami-cleanedkyutai/stt-2.6b-en#18Word Error Rate (WER): 10.57
speech-recognition-on-earnings-22kyutai/stt-2.6b-en#15Word Error Rate (WER): 10.64
speech-recognition-on-gigaspeech-cleanedkyutai/stt-2.6b-en#19Word Error Rate (WER): 8.22
speech-recognition-on-gigaspeech-testkyutai/stt-2.6b-en#17Word Error Rate (WER): 8.28
speech-recognition-on-librispeech-test-cleankyutai/stt-2.6b-en#24Word Error Rate (WER): 1.37
speech-recognition-on-librispeech-test-otherkyutai/stt-2.6b-en#58Word Error Rate (WER): 3.99
speech-recognition-on-spgispeechkyutai/stt-2.6b-en#6Word Error Rate (WER): 1.87
speech-recognition-on-voxpopulikyutai/stt-2.6b-en#25Word Error Rate (WER): 6.45
speech-recognition-on-voxpopuli-cleanedkyutai/stt-2.6b-en#21Word Error Rate (WER): 3.53