Unified Speech Recognition: A Single Model for Auditory, Visual, and Audiovisual Inputs
Open paper
Benchmark
Model
Rank
Results
lipreading-on-lrs2
USR
#2
Word Error Rate (WER): 15.4
lipreading-on-lrs3-ted
USR (self + semi-supervised)
#3
Word Error Rate (WER): 21.5
lipreading-on-lrs3-ted
USR (self-supervised)
#4
Word Error Rate (WER): 22.3
Rank counts only results with a code link.