Sub-word Level Lip Reading With Visual Attention

Benchmark Model Rank Results
audio-visual-active-speaker-detection-on-avaVTP (visual only)validation mean average precision: 89.2%
lipreading-on-lrs2VTPWord Error Rate (WER): 28.9
lipreading-on-lrs2VTP (more data)Word Error Rate (WER): 22.6
lipreading-on-lrs3-tedVTPWord Error Rate (WER): 40.6
lipreading-on-lrs3-tedVTP (more data)Word Error Rate (WER): 30.7
visual-speech-recognition-on-lrs3-tedVTPWord Error Rate (WER): 40.6
visual-speech-recognition-on-lrs3-tedVTP with more dataWord Error Rate (WER): 30.7