Audio-Visual Speech Recognition With A Hybrid CTC/Attention Architecture

Benchmark Model Rank Results
audio-visual-speech-recognition-on-lrs2CTC/AttentionTest WER: 7.0
automatic-speech-recognition-on-lrs2CTC/attentionTest WER: 8.2
lipreading-on-lrs2Hybrid CTC / AttentionWord Error Rate (WER): 50