Unified Speech Recognition: A Single Model for Auditory, Visual, and Audiovisual Inputs

Benchmark Model Rank Results
lipreading-on-lrs2USR#2Word Error Rate (WER): 15.4
lipreading-on-lrs3-tedUSR (self + semi-supervised)#3Word Error Rate (WER): 21.5
lipreading-on-lrs3-tedUSR (self-supervised)#4Word Error Rate (WER): 22.3