Audio-Visual Speech Recognition With A Hybrid CTC/Attention Architecture
Open paper
Benchmark
Model
Rank
Results
audio-visual-speech-recognition-on-lrs2
CTC/Attention
–
Test WER: 7.0
automatic-speech-recognition-on-lrs2
CTC/attention
–
Test WER: 8.2
lipreading-on-lrs2
Hybrid CTC / Attention
–
Word Error Rate (WER): 50
Rank counts only results with a code link.