Auto-AVSR: Audio-Visual Speech Recognition with Automatic Labels

Benchmark Model Rank Results
audio-visual-speech-recognition-on-lrs2CTC/Attention#2Test WER: 1.5
audio-visual-speech-recognition-on-lrs3-tedCTC/Attention#4Word Error Rate (WER): 0.9
automatic-speech-recognition-on-lrs2CTC/Attention#2Test WER: 1.5
lipreading-on-lrs2Auto-AVSR#1Word Error Rate (WER): 14.6
lipreading-on-lrs3-tedAuto-AVSR#1Word Error Rate (WER): 19.1
visual-speech-recognition-on-lrs3-tedCTC/Attention#1Word Error Rate (WER): 19.1