Deep Audio-Visual Speech Recognition

Benchmark Model Rank Results
audio-visual-speech-recognition-on-lrs2TM-CTC#5Test WER: 8.2
audio-visual-speech-recognition-on-lrs2TM-Seq2seq#6Test WER: 8.5
audio-visual-speech-recognition-on-lrs3-tedTM-seq2seq#12Word Error Rate (WER): 7.2
automatic-speech-recognition-on-lrs2TM-seq2seq#6Test WER: 9.7
automatic-speech-recognition-on-lrs2TM-CTC#7Test WER: 10.1
lipreading-on-lrs2TM-seq2seq + extLM#11Word Error Rate (WER): 48.3
lipreading-on-lrs2TM-CTC + extLM#12Word Error Rate (WER): 54.7
lipreading-on-lrs3-tedTM-seq2seq#15Word Error Rate (WER): 58.9