End-to-end Audio-visual Speech Recognition with Conformers

Benchmark Model Rank Results
audio-visual-speech-recognition-on-lrs2End2end Conformer#4Test WER: 3.7
audio-visual-speech-recognition-on-lrs3-tedHyb-Conformer#9Word Error Rate (WER): 2.3
automatic-speech-recognition-on-lrs2End2end Conformer#4Test WER: 3.9
lipreading-on-lrs2Hybrid CTC / Attention#8Word Error Rate (WER): 39.1
lipreading-on-lrs3-tedHyb + Conformer#13Word Error Rate (WER): 43.3